{"as_of":"2026-08-19T15:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f07e756a4a3a15015d2e7f3f4462f1280e64bdd69fe424f08f78d71c58966cb","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T10:47:41.183211Z","state":"measured"},{"denominator":89,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":89,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T22:09:38.842587Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T00:31:39.939203Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2606.11576","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.11576","snapshot_observed_at":"2026-08-06T00:31:39.939203Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","venue":"cs.CV","work_id":"ba0afa6a-7e84-4680-a4b5-27ac02e6b43d","year":2026},"citing_paper":{"arxiv_id":"2608.01207","last_updated":"2026-08-05T05:56:24Z","snapshot_observed_at":"2026-08-14T14:36:16.614079Z","submitted_at":"2026-08-02T12:47:39Z","title":"It's the Decoding Format, Not the Perturbation: Auditing Consistency-Based Selection for Vision-Language Test-Time Scaling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T00:31:37.971062Z"},"links":{"cited_paper":"/paper/2606.11576","citing_paper":"/paper/2608.01207"},"observation_digest":"sha256:5cff71b1b60905dd7131ad82ac5e3a77308c072cc46bdea14b75f95eb68c33b3","observation_id":"94581dcf-32f0-4a7d-a91d-e740d1b659df","resolution":{"observed_at":"2026-08-06T00:31:40.050482Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.11576","snapshot_observed_at":"2026-08-06T04:18:03.076604Z","title":"Derpanis, Babak Taati, and Radek Grzeszczuk","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01207","last_updated":"2026-08-05T05:56:24Z","snapshot_observed_at":"2026-08-14T14:36:16.614079Z","submitted_at":"2026-08-02T12:47:39Z","title":"It's the Decoding Format, Not the Perturbation: Auditing Consistency-Based Selection for Vision-Language Test-Time Scaling","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T04:18:03.076604Z"},"links":{"cited_paper":"/paper/2606.11576","citing_paper":"/paper/2608.01207"},"observation_digest":"sha256:eba948496784455e8f3e60ea7ea5f91f6a07f5c92e36c0a0aad4f44dc8368b0b","observation_id":"100e795c-0d12-452d-b2fe-f0ce1c4abafa","resolution":{"observed_at":"2026-08-06T04:18:03.076604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.11576","snapshot_observed_at":"2026-08-11T22:09:38.842587Z","title":"arXiv preprint arXiv:2606.11576 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09176","last_updated":"2026-08-10T06:40:18Z","snapshot_observed_at":"2026-08-19T09:53:09.188507Z","submitted_at":"2026-08-10T06:40:18Z","title":"Not All Visual Tokens Are Equally Safe to Remove:Consequence-Sensitive Visual Token Compression","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T22:09:38.842587Z"},"links":{"cited_paper":"/paper/2606.11576","citing_paper":"/paper/2608.09176"},"observation_digest":"sha256:ba2fe3501d1469d9d1f64d42a9bcad1f37461c130c80e0bfa2999a9a4ac2dabc","observation_id":"0e7fd8d1-21cb-4921-a874-0d840380841b","resolution":{"observed_at":"2026-08-11T22:09:38.842587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.11576/citation-record","integrity":"/paper/2606.11576/integrity","json":"/paper/2606.11576/citation-record.json","paper":"/paper/2606.11576"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:5c63a21efc6fdc3e25a904ffff16a269e1b3101c5620c01e1224000e573e09b7","observation_id":"c1d10113-6a0c-4d28-a8b4-b2d7739a5272","resolution":{"observed_at":"2026-07-03T08:17:45.829559Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"LLaV A-OneVision: Easy Visual Task Transfer.Transactions on Machine Learning Research, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:f6490dfd61ee9533aa52bdf56625e67a2c93ef260595bdabd2abab513a501156","observation_id":"bd52fa1e-df50-4ad0-8d31-20f3e5bccc3d","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-17T09:56:52.502317Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:c1464e40c4dbc9fa56618d3c3b62f95c6e32061ed14f0a078600685c5b6f0ab8","observation_id":"ec2a6cad-d544-4e94-895d-a2fbaeb50613","resolution":{"observed_at":"2026-07-03T08:17:45.830470Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:a34732c49f1dcc565236cd568cb97255279a6d0d38370a9e222041bae1495d0e","observation_id":"27228014-78f0-4134-ac44-79659ba643a6","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:c46aac409247b5aa24e096d566f776fbe26178308b785d2726b84471862fd1d9","observation_id":"425fd672-8555-450b-8ae0-4d147f4bda38","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:dd42797e7513ea9eab5736d7a9dae62675b1f993c7c7c1545e5f3ff2df66844c","observation_id":"cae7c323-968f-49b6-9fbd-5210bdf1ed4c","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Ziegler, Ryan Lowe, Chelsea V oss, Alec Radford, Dario Amodei, and Paul Christiano","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:88bef02f9831c5d87c03fb0e11d6211a329730ec276314f1c382ca387e243c3c","observation_id":"51a2785a-af28-4695-919e-22675b4baf02","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Evaluation of Best-of-N Sampling Strategies for Language Model Alignment.Transactions on Machine Learning Research, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:e49ae9b61ebabec0b72a5a30acc23abef8da8fbc57108d5a734e6bd5f96b6388","observation_id":"8c6c65d2-ccb7-4d8f-98b7-b40acae309ee","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:98d477978b64eaf4d88c984883fa36d59325e18b63871703978e7533ed9bd3eb","observation_id":"01a4a787-68f3-4871-b3a9-54fde78796d6","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:1694df41729eb752fbe837668a7dc6268ee1f510f72242e18fbe742f2a3839a4","observation_id":"0ee07fd5-6180-4424-8c6d-503e2ba45f88","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"LLaV A-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:65e847093e685b0b781a1d3c81a8bbdc3bd00dab49878fd3ed09de91af3988d1","observation_id":"38844e25-3d3f-4444-854e-b25c4fb62241","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.11109","doi":"10.48550/arxiv.2512.11109","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Limits and Gains of Test-Time Scaling in Vision-Language Reasoning","venue":"arXiv (Cornell University)","work_id":"965b60a0-6b7c-4cc8-82c6-99f72443f8e6","year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:c7138090c2d77e4b619c00ce80d1b0369e77ab2a71e010e3c99cd4c7ad92f780","observation_id":"e16d7e38-1593-43ee-a354-a52ae2db81c0","resolution":{"observed_at":"2026-07-03T08:17:45.853645Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Visual Instruction Tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:efe411d451687dbdb4bb6288e5bc6d6649b9b4afd336576cc5563dfeaf9e9384","observation_id":"087cc637-eeed-4ff3-bfbd-2f3860f7e51a","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"BLIP-2: Bootstrapping Language-Image Pre- training with Frozen Image Encoders and Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:03a16145036cc13340f93532612e00026663bd26c4a08bfb3bc45dcf7dbcbb34","observation_id":"d3e747b1-894c-4718-afff-6ed93a32062f","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"LLaV A- NeXT: Improved Reasoning, OCR, and World Knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:66b35701f40809dcb29905c6b7b850044ad1a2133daa4705a0da4c40d42ad081","observation_id":"905779dc-3e25-470e-988e-11643f7f7c4c","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"LLaV A-CoT: Let Vision Language Models Reason Step-by-Step","venue":null,"work_id":null,"year":2087},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:a0c2eb076d46cb7c023d7f846aa858d51a0911471a46f14808d49ab2b282ac0d","observation_id":"36731078-b9d7-4c09-808d-d70e45670558","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:43aaee8e59538560a0c657a450da7b3e5d8ca2d3954e853690edb000638fcec7","observation_id":"72064742-5105-426b-8ecd-cdc7f2488570","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:41573b8f235f81155adad8d8f27b2cb80f75bcc9a4a16b2243776df086268487","observation_id":"9f3b7609-3c84-4d53-aa03-14f915f7ad40","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.14944","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T08:17:45.890490Z","title":"Puzzle Curriculum GRPO for Vision-Centric Reasoning.arXiv preprint arXiv:2512.14944, 2025","venue":null,"work_id":"6488c397-094f-4a5d-9b75-9823954ef2b1","year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:3a22820ef0632e09cb714bd5af4262bfe2321c7947e0ec957b884bb80382d832","observation_id":"2aed1795-662e-4db5-a588-7bd1f7bf7e9f","resolution":{"observed_at":"2026-07-03T08:17:45.892179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-14T23:38:19.973422Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:9e36628830106301d27aefeb9c67057db247a85f98b58a11d7835357f3b966f6","observation_id":"6e42a8d8-6041-4a40-a37e-c7654626e1af","resolution":{"observed_at":"2026-07-03T08:17:45.894692Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:a639bb2d74f3db1d1e34e832737e0b7d9adc6b90f47509ba62ab8fe47a65e44d","observation_id":"b3eb7964-fa77-4a78-b4dc-b970b3884e84","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.01301","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T08:17:45.836055Z","title":"When Does RL Help Medical VLMs? Disentangling Vision, SFT, and RL Gains.arXiv preprint arXiv:2603.01301, 2026","venue":null,"work_id":"ef69a73a-0419-4bff-8871-6f3a77bcdb83","year":2026},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:02533a06d38d0db8a089c3e774cc1a2365b4ceba65d71e49dc1c2e63298f6f6d","observation_id":"742ba8f3-c0f9-4678-bfab-e399f5d2bb6a","resolution":{"observed_at":"2026-07-03T08:17:45.837527Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:c94215b9b49fdfeca8dd1075cc7ceafa02a9889af195ae128d566b901d39a5bd","observation_id":"e38bf516-a527-4225-8fd5-2168b2346526","resolution":{"observed_at":"2026-07-03T08:17:45.897113Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-08-14T10:00:52.343929Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":"2407.21787","doi":"10.48550/arxiv.2407.21787","metadata_source":"pith","pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","venue":"cs.LG","work_id":"b124064d-5a56-42ad-86f5-3cc349b86a3a","year":2024},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:e1e1723182f032ecabd58071e7cc9c4445ec23fd5fd8f256dd9a4e79588f46c0","observation_id":"ab321964-d0aa-45d7-bc3f-d5d8a82875fd","resolution":{"observed_at":"2026-07-03T08:17:45.889259Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-12T02:20:41.492703+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T02:20:41.492703+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Majority of the Bests: Improving Best-of-N via Bootstrapping","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:b18f338c8de8c98a7e4353666024a3dcf7fb26f300302e39c7f8054b379cc1c6","observation_id":"299826ec-235d-4284-9d1e-6b7e704518ff","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Self-Refine: Iterative Refinement with Self-Feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:8049bfb4325da78bcfa1a3d46a6f976e0a23e7c245d8dd434029252e5c8770d8","observation_id":"4c327420-b881-45b2-a2bd-b0f7136fda44","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Let’s Verify Step by Step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:be11b9a4238f873d2ea10fb06535333d01de793d635d58eef156474dc6360e6d","observation_id":"6d96d1cb-d588-49b6-8129-821e39e7d313","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:b2a30990b1de10df078a2c9c159bc99b90297a4d9a361c03efe1838acba325e4","observation_id":"61c055f9-9f92-4601-92d0-aa93e4818f0e","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"s1: Simple Test-Time Scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:4e0de960bd62e20f22b2976b248a0f4a532a887b7bb639469a58eeb44445a78f","observation_id":"55e7a0d6-a857-4bea-98eb-601dd7cc944a","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11274","last_updated":"2026-04-17T08:29:27Z","snapshot_observed_at":"2026-08-15T18:32:29.229867Z","submitted_at":"2025-05-16T14:08:04Z","title":"SelfBudgeter: Adaptive Token Allocation for Efficient LLM Reasoning","version":6},"cited_work":{"arxiv_id":"2505.11274","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.11274","snapshot_observed_at":"2026-07-04T10:39:45.819564Z","title":"SelfBudgeter: Adaptive Token Allocation for Efficient LLM Reasoning","venue":"cs.AI","work_id":"cf7e4740-947f-49ca-a139-70469439ba99","year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"cited_paper":"/paper/2505.11274","citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:5f8156fb731e095b3021e8dfe2ccca98687318169694abcb84fcaca2b5701503","observation_id":"1c16a5dc-dadb-4fb5-8ea1-f9021b8ff470","resolution":{"observed_at":"2026-07-03T08:17:45.855439Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02725","last_updated":"2024-10-03T17:47:29Z","snapshot_observed_at":"2026-08-19T04:42:46.631290Z","submitted_at":"2024-10-03T17:47:29Z","title":"Adaptive Inference-Time Compute: LLMs Can Predict if They Can Do Better, Even Mid-Generation","version":1},"cited_work":{"arxiv_id":"2410.02725","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.02725","snapshot_observed_at":"2026-07-08T04:04:29.259300Z","title":"Adaptive inference-time compute: Llms can predict if they can do better, even mid-generation.ArXiv, abs/2410.02725, Oct 2410","venue":"cs.CL","work_id":"79691acb-8f71-468b-a082-471ef94ca94f","year":2024},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"cited_paper":"/paper/2410.02725","citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:ecd1124f9851d4781f062246f4ad9ef3269d5210fa9fb415bb339c05d9591373","observation_id":"3e831cad-a8a7-4145-a1a7-e22b4c8de4be","resolution":{"observed_at":"2026-07-03T08:17:45.848719Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Scaling LLM Test-Time Compute Opti- mally can be More Effective than Scaling Model Parameters","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:456eca236d01756dec213edcf98e960c5ff2a8867cc971d4a7558ff216c4d1f1","observation_id":"ed61dc1a-580c-4023-916f-dbf868dd6c80","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Learning How Hard to Think: Input-Adaptive Allocation of LM Computation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:ca24453267f9ac21ee85f8b58c892322e3492ac2b6ed858ef974bfac18d7d48a","observation_id":"c0b93ebd-32e2-45cb-a59a-9438605e49f2","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-16T21:20:10.865400Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"cited_work":{"arxiv_id":"2506.07971","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07971","snapshot_observed_at":"2026-07-03T08:17:45.840937Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding.arXiv preprint arXiv:2506.07971, 2025","venue":null,"work_id":"e071dfb1-d529-4453-a51c-aa0401f03ea3","year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"cited_paper":"/paper/2506.07971","citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:5f2499e0bbaf7837af665aa77fbbf72a46a6701957cddff781e2a8b387565532","observation_id":"bec2ef43-3501-4268-ade0-ea680fe68fe0","resolution":{"observed_at":"2026-07-03T08:17:45.842398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.11830","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T08:17:45.843476Z","title":"Vista: Mitigating semantic inertia in video-llms via training-free dynamic chain-of-thought routing","venue":null,"work_id":"5cddb8eb-78d4-4b20-880a-1b55dd3bab9f","year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:e1895c2dfd5a966893d26151383da1ba2614857f211fc8fdd0ac6fb0a0f02a91","observation_id":"bb97b15e-69c1-411b-b3b6-05a219fbbe90","resolution":{"observed_at":"2026-07-03T08:17:45.844988Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14568","last_updated":"2026-04-16T02:59:30Z","snapshot_observed_at":"2026-08-15T17:14:26.266900Z","submitted_at":"2026-04-16T02:59:30Z","title":"Learning Adaptive Reasoning Paths for Efficient Visual Reasoning","version":1},"cited_work":{"arxiv_id":"2604.14568","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.14568","snapshot_observed_at":"2026-07-03T08:17:45.846418Z","title":"Learning Adaptive Reasoning Paths for Efficient Visual Reasoning","venue":"cs.CV","work_id":"d368040d-2a4f-46f0-b21e-2e71954c34c1","year":2026},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"cited_paper":"/paper/2604.14568","citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:f5c05c7193873bcd8372ae0d7474bf120f1ec4f97b3135bbafebb722e315b1c2","observation_id":"37009677-e164-4331-94ee-6427dc504079","resolution":{"observed_at":"2026-07-03T08:17:45.847646Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"ARES: Multimodal Adaptive Reasoning via Difficulty-Aware Token-Level Entropy Shaping","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:d8f894d4cb5de1762971253007095129afa9474f7d26c45b5a445b1957d00b0a","observation_id":"9dbd312c-ab38-4353-abba-14e53e86babe","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Efficient Test-Time Scaling for Small Vision-Language Models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:60556a4511917816274629a8ec4390511d3b2eb353532ca4aa416e057577284a","observation_id":"e91a4022-da5f-4c1c-b022-f8fb5c3f7a72","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Improve Vision Language Model Chain-of-thought Reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:628b9f40922a9a7b1996604a575bcac632417d16321b6aad66a1472f6dce80d6","observation_id":"a1a728f2-27eb-4f0e-9a5c-adbf4f408ff1","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.17417","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T08:17:45.848681Z","title":"Aha moment revisited: Are vlms truly capable of self verification in inference- time scaling?arXiv preprint arXiv:2506.17417, 2025a","venue":null,"work_id":"100f69cc-ffc9-4c50-b3b8-e332e51efd7e","year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:c1755f4442a6a7642f3e163898e800196f01a41cf97a0f1af0514771c407b410","observation_id":"c2f37f97-6c6d-47ff-860a-3f66a96f996e","resolution":{"observed_at":"2026-07-03T08:17:45.850204Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11549","last_updated":"2025-03-14T16:12:23Z","snapshot_observed_at":"2026-08-16T12:49:57.297223Z","submitted_at":"2025-03-14T16:12:23Z","title":"Similarity-Aware Token Pruning: Your VLM but Faster","version":1},"cited_work":{"arxiv_id":"2503.11549","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.11549","snapshot_observed_at":"2026-07-04T15:59:57.424957Z","title":"Similarity-aware token pruning: Your vlm but faster","venue":null,"work_id":"ea8bff73-4c5f-498f-9fc2-0c1a010425c7","year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"cited_paper":"/paper/2503.11549","citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:725bb61cc5f41f5c1759803402aa119c41aa0f6585e574fef6ba776b44f6397b","observation_id":"a1e3b4b9-1721-4539-9413-73f061516819","resolution":{"observed_at":"2026-07-03T08:17:45.886204Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:c3bea5e401a80bc560c07e0d13b1a3e7b552ec2aaabc6753efadca995d754f89","observation_id":"cf165c29-1646-4073-9ebc-4ad66361df70","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:1383eb317cc3028cd7254f724f6c4e96a675613e477cac10c23fbe9f72b4d38a","observation_id":"72d7ac93-7673-4491-9f3a-fc9f37fad972","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"VisionZip: Longer is Better but Not Necessary in Vision Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:acb19a22246986e3a9247bd5812f6830c8d92bdb18c1e345d8228dea61e06a83","observation_id":"abf55d21-b095-4827-a0d7-7738819772b1","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"PruneVid: Visual Token Pruning for Efficient Video Large Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:cdf2e0d4c0cb8c5d29e446acee36d7c2fe0ea33f2343ac7d1ca95471d8be3d53","observation_id":"06901dcc-af4c-4161-92f4-676f8d42fed4","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Token Merging: Your ViT But Faster","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:135379aa676933f10bd05a1d0ebc9a246a7dca6ff72dbaadebaed8312ad76530","observation_id":"1c4a636f-f22a-4396-bebb-15e0992cb8b1","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"DivPrune: Diversity-based Visual Token Pruning for Large Multimodal Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:bbefc40cbaf7608791787fb16f0e0f866572c343ab6effaf1d15aa1e5b153280","observation_id":"d5059fa4-e6ac-45b5-b1be-7c25f572cfca","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:a10cf5b379565a835bdc38cd9609949f3dc017b8d0b106579555d501cfc86bdb","observation_id":"fd85ac8e-8961-41b5-b746-a30b97f927d8","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:566230e1b60a2a1e38c39f200fdd3ab69b98a52f3a327672312dcef48913a601","observation_id":"5f38d9df-4fc2-4966-b07f-4e99f125a18c","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"TopV: Compatible Token Pruning with Inference Time Optimization for Fast and Low-Memory Multimodal Vision Language Model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:ec41dc24d60f24c2d3ca292356c694afac2a0292502e022490ce9a98f7801452","observation_id":"a39d5062-6d91-4620-963a-475933721c25","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"CATP: Contextu- ally Adaptive Token Pruning for Efficient and Enhanced Multimodal In-Context Learning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:0dd0deb0ac8c038302b5aea018587bf22929cd0244722478469e4fb9549e5d04","observation_id":"63bc77e3-8231-4112-a387-473ba560c1df","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"FlashAttention: Fast and Memory- Efficient Exact Attention with IO-Awareness","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:d7099e7cbaecb13d74d5ea86a955c57ffb5ffae64b37c559a0f366b29f3324a8","observation_id":"3204da28-5f07-4cd9-9c40-87eec7f451f0","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"VScan: Rethinking Visual Token Reduction for Efficient Large Vision- Language Models.Transactions on Machine Learning Research, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:7e632343052b45087d0a2ac50cb0f2fb66ff991bacda1d69f77359a77432fd7c","observation_id":"194aa806-0e9e-41e0-ae4e-fd6a7db41eba","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"KeyDiff: Key Similarity-Based KV Cache Eviction for Long-Context LLM Inference in Resource-Constrained Environments","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:6284a6b0d6cfcfd548aec1f0d854c775b7c722856b0e9168b3b3fed93838ec34","observation_id":"0d9986cf-33b2-4062-aafa-6d9daa60909a","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"VLMEvalKit: An Open-Source Toolkit for Evaluating Large Multi-Modality Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:106525f1ad47a04fe187539965b6ca635d90bd7a50ba30854fdeb0109dce9517","observation_id":"31df5339-a59d-47c3-afc2-3584911f23d8","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:b54aa41d8c4abef646b9ebdc1ec739866a0de4ed410a2f0ed75424729726c462","observation_id":"0abf0c17-b79d-42be-9b60-6ff67d19e93c","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems? InEuropean Conference on Computer Vision, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:e8e4c7aeb0a6010c18a86658ddd88835b9c6fd26e03b7798979bdd0437fc4821","observation_id":"3d5a536d-7141-40b1-bc52-b4c520926909","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset.Advances in Neural Information Processing Systems (NeurIPS), 37:95095–95169, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:b08f21d9db94258613c79ac3ae4212e3542e428bdebf1c245e8b5547661eca40","observation_id":"c586b138-e026-4719-9f58-780e3cd94b57","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"DocVQA: A Dataset for VQA on Document Images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:77d7eedb0186dd96ca7e9cff7b0f372c836b8c32492b64a25467634f7f50c657","observation_id":"9dcd9a28-6285-40c7-ab2c-6ee507bdc2e1","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:4c01319d6084a7f402d64cedf869a6c9e714936dbead7a51b50eae79588a95f6","observation_id":"3bcb69df-7035-4877-bc02-b85a5c0027c7","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:ca7190ee2a08b5bd4441c72c49340be2d2053657aa69af2b9f95bd0e08d66fdc","observation_id":"c373c94d-748c-47b3-9de4-a5b9312d4020","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models? InAdvances in Neural Information Processing Systems (NeurIPS), 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:3c4c2505fadfd8c9b73da21238443e68d235f4cfb3786be1c40bb0698220ee86","observation_id":"1b58cd25-3106-42f1-bd92-3a042c2a9c8b","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"MMBench: Is Your Multi-modal Model an All-around Player? InEuropean Conference on Computer Vision, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:dc0832c78f895ae78b28f6081cd0c03876b2e39018e6c7a6b8407b52cb24c087","observation_id":"4102869c-37cb-482c-94e8-bedbbb2cf7ea","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:5116de5cf4a3e68d3ba71de132c3bbbd5f0370aed1339783aab13b715e65b567","observation_id":"93d8c24e-56df-432a-80cd-d16399b2fed4","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:99293faf9ee4af9879affa088aeef6c068ad1c3fffd1a237ab143ce4eedfa38b","observation_id":"65262a67-54f0-4467-bfa2-bcbf099eb45e","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:93206d155d8f15f9b1f2b1bcb2b47a76515094742e4602a7bc91b74aae9caa3f","observation_id":"8e8e5a5b-8fa7-4e66-8029-d71d64dd13a9","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Traceable Evidence Enhanced Visual Grounded Reasoning: Evaluation and Methodology","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:8ce9f7f904db74ab6f3ca51839e09d68e65a10b2e6cd7d0326123ed7f54e324c","observation_id":"4ffeb757-ee6c-42c6-845b-eb4e9dc242ba","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:ad7f9cd70f3c2a5f323756fbc25230c5580a13b151fd64b395bffe945409dfd6","observation_id":"349039f5-68e8-4699-bd8d-c0d466c4a2c7","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"TempCompass: Do Video LLMs Really Understand Videos? InFindings of the Association for Computational Linguistics: ACL 2024, pages 8731–8772, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:dc3e1f5dc5846268f8ecd1a614d507be96f573ac4922a0f3521aff6a6c0888da","observation_id":"fef393f5-4bfb-48dc-a064-20bb0c0b9bc2","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Towards Video Thinking Test: A Holistic Benchmark for Advanced Video Reasoning and Understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:ec6c6070d717821c9307104f41f6e8a4eac3d5d3e450fc280b2b3693cadc2d87","observation_id":"3b3bce9f-06b3-445b-b472-df869a9fbc17","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:0d1945d123dffd7995bc49d272edba3ada7616ec1477a1009b55fd63d3ae3a9d","observation_id":"fb99e5a9-a171-4409-9dc0-eb817966d233","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Q-Bench-Video: Benchmark the Video Quality Understanding of LMMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:5058f63437341ff136fdb7aee9a7b8fe222f5c883daed1b54efd4b0325bf961e","observation_id":"58316217-3316-4300-bc9b-2a9080b7e29d","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-08-16T03:39:21.994462Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"cited_work":{"arxiv_id":"2501.13826","doi":"10.48550/arxiv.2501.13826","metadata_source":"pith","pith_arxiv_id":"2501.13826","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","venue":"cs.CV","work_id":"365a8624-64bf-45a7-8a3e-c575aba224dc","year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"cited_paper":"/paper/2501.13826","citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:f72b3707d3ca7acac8d8022aed57edfeeebf739b4935f180424331ec025bb9e1","observation_id":"477122f4-1492-47ec-b288-ce6ac919f074","resolution":{"observed_at":"2026-07-03T08:17:45.846147Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:da98e913469178a2381753a091d29e47532f7972232003d84c1f81aa66cc6c1d","observation_id":"cdf5bef9-e05c-4e55-a5ba-be5961c06ac5","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:f09837543605952948c5e7d5a41b008274d110f06727b02387de8d4bc250305c","observation_id":"f1b05748-a5e5-4f6a-b77b-ce0da3055a87","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:51cf0ed38e6b26465693f543963efe0d171dd3c435306a82de7425af33732cf2","observation_id":"0781584f-13ad-4afd-8480-cde6783bf8a0","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"LLaV A-Video: Video Instruction Tuning With Synthetic Data.Transactions on Machine Learning Research, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:938cd00b88915682093d37dfcab13a743bffa658eed0ef08255ed8d3f42ee679","observation_id":"80c56837-1c06-4d64-87bd-666e635e9582","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"A- OKVQA: A Benchmark for Visual Question Answering using World Knowledge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:539a15223c4e8e0b269a7ec58418449435796c66b5be44e632ac6292fe4a8cb9","observation_id":"1c76ad6c-71e5-4935-b2f9-16bd3eaa3c37","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"A Diagram Is Worth A Dozen Images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:4a83effd35498bbda1b364db131f94c915458e71a002d05fda62db189e91b63a","observation_id":"c8324f67-9fb9-4970-adc8-9d5e3a03ce92","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Are You Smarter Than a Sixth Grader? Textbook Question Answering for Multimodal Machine Comprehension","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:bad9463d0390f396bf2662dce4be44d19dbab63f4db38f683dad4423ee198d94","observation_id":"4730b2f8-e46a-4d3f-96de-10976aa182b1","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:f33edeb09c8baf2add8fa4d6ba834756f6f6935576946cae3757162eaec926bf","observation_id":"5f1b29ca-cfde-4359-9103-f79fd6369aeb","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Learn to Explain: Multimodal Reasoning via Thought Chains for Science Question Answering.Advances in Neural Information Processing Systems, 35:2507–2521, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:b4771333fbc057ab3d33ea6bc334a4a5ee18c21eb0c3ebb63ddcf7000e7af794","observation_id":"6aae95e4-c377-4639-8cdb-bc4ade857cd2","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:1c2bd95df6f1aeb1b926ccd0c5fdd67d75c0f0f7325e51ea50ac5a637d61910a","observation_id":"ba7e04dc-8421-4f85-b33f-42c64933907a","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:adb04e03261dc58d211141bde70f16e542d2579c412ac07a2554f2db6f9c6468","observation_id":"ed2d3af1-df27-4b17-8d27-b92274981a9d","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:67485027293444b25881570d867b34f340f17fcf2db8127c35a42ee207b03a96","observation_id":"e0973a0c-117a-4aa3-81ee-87c8776e8ae8","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T10:47:41.183211Z","title":"Guidelines: • The answer [N/A] means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-27T10:47:41.183211Z"},"links":{"citing_paper":"/paper/2606.11576"},"observation_digest":"sha256:7f0d1cecac36645390d333ab924643901db82be327c20b86711e1170986237f5","observation_id":"300c80a8-6768-4b64-8bad-cb125859067d","resolution":{"observed_at":"2026-06-27T10:47:41.183211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.11576","last_updated":"2026-06-10T02:06:47Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T18:34:57.083557Z","submitted_at":"2026-06-10T02:06:47Z","title":"AVIS: Adaptive Test-Time Scaling for Vision-Language Models"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":69,"verified_exact":16,"verified_fuzzy":0},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 3 inbound Pith citation observations for arXiv:2606.11576."}