{"as_of":"2026-08-08T07:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:98f36be8edf3c95e943f9b1077295cd686d40dbb893183f7384680db4ed96efe","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:48:35.027792Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T21:58:53.702009Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T17:37:14.448914Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2506.12776","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12776","snapshot_observed_at":"2026-07-02T17:37:14.448914Z","title":"Native visual understanding: Resolving resolution dilemmas in vision- language models","venue":null,"work_id":"9e48fa37-995a-49f0-8bbc-1c01c9c71aaf","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-06T11:22:47.957500Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2506.12776","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:f538f925c6118e0b2b34eb60945ea6b1f82904d21260013f09bac5fe3cd46219","observation_id":"e7ab0eda-b5a6-4a65-9a70-0eda9239920e","resolution":{"observed_at":"2026-05-17T13:25:32.034155Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2506.12776","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12776","snapshot_observed_at":"2026-07-02T17:37:14.448914Z","title":"Native visual understanding: Resolving resolution dilemmas in vision- language models","venue":null,"work_id":"9e48fa37-995a-49f0-8bbc-1c01c9c71aaf","year":2025},"citing_paper":{"arxiv_id":"2604.04771","last_updated":"2026-04-09T09:16:34Z","snapshot_observed_at":"2026-08-05T17:53:24.301280Z","submitted_at":"2026-04-06T15:44:18Z","title":"MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T18:58:41.377996Z"},"links":{"cited_paper":"/paper/2506.12776","citing_paper":"/paper/2604.04771"},"observation_digest":"sha256:2ed81624b1808be179ce2fc44e688fc4746fd73710b4d86d60d4b29056cbe35e","observation_id":"112900c6-95c3-433a-b8c0-8835c23ea18c","resolution":{"observed_at":"2026-05-10T23:35:52.439397Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2506.12776","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12776","snapshot_observed_at":"2026-07-02T17:37:14.448914Z","title":"Native visual understanding: Resolving resolution dilemmas in vision- language models","venue":null,"work_id":"9e48fa37-995a-49f0-8bbc-1c01c9c71aaf","year":2025},"citing_paper":{"arxiv_id":"2606.07861","last_updated":"2026-06-05T21:49:34Z","snapshot_observed_at":"2026-08-02T02:56:55.871904Z","submitted_at":"2026-06-05T21:49:34Z","title":"The Last Visible Pixel: Probing Fine-Scale Perception in Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T21:58:53.702009Z"},"links":{"cited_paper":"/paper/2506.12776","citing_paper":"/paper/2606.07861"},"observation_digest":"sha256:e339460d308692435b376be0d695ebb6e2b8dfc279d50eb6aeb1ee4f5ce467b8","observation_id":"0fe9215b-8e3c-4eae-9b83-3f1e8e898893","resolution":{"observed_at":"2026-07-02T17:37:14.450399Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12776/citation-record","integrity":"/paper/2506.12776/integrity","json":"/paper/2506.12776/citation-record.json","paper":"/paper/2506.12776"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T00:48:28.130945Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:28.130945Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:944593beadc2436f332c60eb9ebf33043eb7350ea50f70e343bd52392135a143","observation_id":"e0e82b7c-81b1-41c4-a0b5-6c052a6f472b","resolution":{"observed_at":"2026-08-07T00:48:28.130945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T00:48:28.212811Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:28.212811Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:b6d809b5e533716e3fc8154f0a0e969374b94a274b4ff7fde2e7b4f8c683ba11","observation_id":"6369f684-748a-4e43-9414-9bc5a166ee8b","resolution":{"observed_at":"2026-08-07T00:48:28.212811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:37.856155Z","title":null,"venue":null,"work_id":"d90a7ebd-30e9-4d71-93ab-f23737459de3","year":2019},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:28.348014Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:d85a48d800313320669a99416f971b5625d7e7c8e9b95818b01f0049a648a29f","observation_id":"80ce4dc1-81d8-4543-8384-df02b0d133c3","resolution":{"observed_at":"2026-08-07T00:48:37.930240Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15558","last_updated":"2025-01-26T15:20:39Z","snapshot_observed_at":"2026-08-06T19:35:19.984769Z","submitted_at":"2025-01-26T15:20:39Z","title":"Ocean-OCR: Towards General OCR Application via a Vision-Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15558","snapshot_observed_at":"2026-08-07T00:48:28.448857Z","title":"Ocean-ocr: Towards general ocr application via a vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:28.448857Z"},"links":{"cited_paper":"/paper/2501.15558","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:0071571ec9f01f8f7d5200d2a0bea8226d5a6867ccda44a3ed1fac589b30977d","observation_id":"3a605ce2-499d-4e75-a0b5-7159b53b774b","resolution":{"observed_at":"2026-08-07T00:48:28.448857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T00:48:28.559091Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:28.559091Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:e69845a88c864bf19acaa9c61ce840b0535b1cb2bf8f2820242e179b5aee9273","observation_id":"92ffee03-72d9-4c73-9c81-4513847c6dcf","resolution":{"observed_at":"2026-08-07T00:48:28.559091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:28.686334Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:28.686334Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:74458f26d7338378f1633adf013e1b7323b0c827d181a380d115815c14a7e703","observation_id":"f7d0afd1-97d5-4d80-80f4-e03ef8c6561c","resolution":{"observed_at":"2026-08-07T00:48:28.686334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:28.785387Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:28.785387Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:56a39b4d9201cb162da12169a80afc8870e260b15641a5e61d4715ceb941ffef","observation_id":"b260ec6d-0bbb-4899-8e6c-51b9aff3a854","resolution":{"observed_at":"2026-08-07T00:48:28.785387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:28.885481Z","title":"FlashAttention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:28.885481Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:cd92a4ced5a61415d24e614964f99b669cde57d871fb67d94e674f1317e88358","observation_id":"72c52b55-10e8-4431-bf04-c0040d6601aa","resolution":{"observed_at":"2026-08-07T00:48:28.885481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:28.989104Z","title":"Bert: Pre-training of deep bidi- rectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:28.989104Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:1a70a9bc45b8fff57f06dbb6034b37364329d8e3787c76741b0be6372846c6b7","observation_id":"15e0b855-cade-44c4-8722-8e0b0d8f28aa","resolution":{"observed_at":"2026-08-07T00:48:28.989104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T00:48:29.154407Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:29.154407Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:63dc692fa80de3f9fba6d8b594c88fad312019d220278d800f1a6a7f935106f5","observation_id":"afc9fdcc-c093-4040-8fc8-8c54c2b820d5","resolution":{"observed_at":"2026-08-07T00:48:29.154407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:37.652403Z","title":"Gpt-3: Its nature, scope, limits, and consequences","venue":null,"work_id":"e9b17f95-319c-4d2c-b808-1fe1d7b3ce8b","year":2020},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:29.255022Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:2f9f6b432d0659ad9ce308b8f5ab738342f80614540505aca1103fed4e9fcb76","observation_id":"34d6d148-e214-4a23-b785-302d79a40750","resolution":{"observed_at":"2026-08-07T00:48:37.749092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T00:48:29.381519Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:29.381519Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:2761d63e666bab577b79ed96f239a74bdf264a7f5871ed7109c07fb5a1d26d71","observation_id":"e32e37fb-45e4-4006-ada8-2c8766dc3bcc","resolution":{"observed_at":"2026-08-07T00:48:29.381519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-07T17:13:10.057242Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-07T00:48:29.512536Z","title":"Ocrbench v2: An improved benchmark for evaluating large multimodal models on visual text localization and reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:29.512536Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:8e7d81737220f84837cb42d1fb9e6d94c81f8fff25f080ceae00d9715f1209db","observation_id":"79bd0a28-93a8-4458-9fc0-5186a0340428","resolution":{"observed_at":"2026-08-07T00:48:29.512536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:37.420997Z","title":"Seed1.5-vl technical report, 2025","venue":null,"work_id":"b4ad5b8e-05e3-4896-bf7d-778f307d8501","year":2025},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:29.634978Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:c0c7e1bb36bd8264c8862ceb0b740a864d9136d2363e149bca4a1eee49218eee","observation_id":"1d2629bd-4eee-4440-90d2-4227f3240ef6","resolution":{"observed_at":"2026-08-07T00:48:37.524920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:37.233208Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":"05ba28eb-7a01-42f0-af43-734cfb6de489","year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:29.741955Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:b27a91a19737525f305525439a14a7768bf567d2c83510b6029707065dd8f69d","observation_id":"383e8978-26b3-4a4a-8418-e1043bfa123e","resolution":{"observed_at":"2026-08-07T00:48:37.308102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:29.843867Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:29.843867Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:70cc9ed960c561aebbdd77fe880cf03c580d1381862a471c0d1161ebe533c4ef","observation_id":"e7ff2c4b-6a7e-4a70-a0bc-1de1c4fcf400","resolution":{"observed_at":"2026-08-07T00:48:29.843867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.11943","last_updated":"2021-03-22T15:34:39Z","snapshot_observed_at":"2026-08-04T14:58:50.151028Z","submitted_at":"2021-03-22T15:34:39Z","title":"BERT: A Review of Applications in Natural Language Processing and Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.11943","snapshot_observed_at":"2026-08-07T00:48:29.931868Z","title":"Bert: a review of applications in natural language processing and understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:29.931868Z"},"links":{"cited_paper":"/paper/2103.11943","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:2c2675454620b47cb5b4f970ecd3f458a9950f11197af219019f5c2d6dfbf039","observation_id":"757c8926-79bc-4b83-8eef-656cf9bd9112","resolution":{"observed_at":"2026-08-07T00:48:29.931868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T00:48:30.085311Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:30.085311Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:5850361ffa717e334c01326d944421500f0f6ef9a2e451a22ca645ae03f47333","observation_id":"f45a04d0-49c7-4083-9a7b-458e621671fc","resolution":{"observed_at":"2026-08-07T00:48:30.085311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-08-07T00:48:30.185030Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:30.185030Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:5969b3dc98801eaae5ff725d536279bb1dbb9cf4e1b3c141915383c9e28d7a98","observation_id":"d0599d4f-1320-4427-957d-93ceb82ad4d3","resolution":{"observed_at":"2026-08-07T00:48:30.185030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T00:48:30.316110Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:30.316110Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:f4521bb08c3e08762e7b8e18c45a6ec7023c4e0d987691b96a9e626e457fe36e","observation_id":"ecc99e65-9cfe-4be9-8062-c03588f67105","resolution":{"observed_at":"2026-08-07T00:48:30.316110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-07T00:48:30.416053Z","title":"Tokenpacker: Efficient visual projector for multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:30.416053Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:ce2d387b58ca1f8bbdd3543cdaacb9ba95f53211c75f4418070b8b4529cac7be","observation_id":"4294a87b-37ca-4dd7-8684-3793d217ceef","resolution":{"observed_at":"2026-08-07T00:48:30.416053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-07T00:48:30.535552Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:30.535552Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:8a4b4a4a92dd1e52bf1d28705b2149f5ec2a2bef34beab5745179ab5a15234e1","observation_id":"c8e8a796-7b0c-4d36-bc25-67623a38812a","resolution":{"observed_at":"2026-08-07T00:48:30.535552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-07T00:48:30.624519Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:30.624519Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:6c3f7eb95e4a51e500f308893ae48d195524524f1c9c29dbbebd417b29bc988b","observation_id":"4544fb5c-1eb9-4760-9932-a995bd17dc91","resolution":{"observed_at":"2026-08-07T00:48:30.624519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:30.741494Z","title":"Monkey: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:30.741494Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:51761220b9b977bf9f09d0601b9d1b6b7eed09483d41199ca4f20feed8464b82","observation_id":"d39cb784-ac20-49f6-858e-3926719fd61f","resolution":{"observed_at":"2026-08-07T00:48:30.741494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14818","last_updated":"2025-01-20T18:40:47Z","snapshot_observed_at":"2026-08-06T02:17:30.272046Z","submitted_at":"2025-01-20T18:40:47Z","title":"Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14818","snapshot_observed_at":"2026-08-07T00:48:30.849435Z","title":"Eagle 2: Building post-training data strategies from scratch for frontier vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:30.849435Z"},"links":{"cited_paper":"/paper/2501.14818","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:57eb88b54c539a41e18725bf0b319b93c6547eb56e1ccdb619a908ec55d09d8b","observation_id":"bf36f4bd-1fae-47c5-85ba-3a755db47a5a","resolution":{"observed_at":"2026-08-07T00:48:30.849435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:30.977433Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:30.977433Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:34dfe7b7ec20414002174db9e04771cfb14147b35260109444956e22b1660d05","observation_id":"316f67e6-7fba-4b5e-84ee-da9e18e278e2","resolution":{"observed_at":"2026-08-07T00:48:30.977433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:37.048091Z","title":"LLaV A-NeXT: Improved reasoning, ocr, and world knowledge.https://llava-vl.github.io/blog/ 2024-01-30-llava-next/","venue":null,"work_id":"2a5a0d57-194d-46f5-8004-527c9c3d36ab","year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:31.082464Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:9cc93405516d16c98d3d73e5bd164e44623a31cbb6b7defa0b69f20eff8e5934","observation_id":"c7c5f576-1235-4f76-ae9b-4cc6d7c4d51b","resolution":{"observed_at":"2026-08-07T00:48:37.142439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:31.182343Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:31.182343Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:cc10bdfd860848492e5c30bb0ee307d6f03262363d60200b1d8602d79e2615ea","observation_id":"50640e39-879f-48dd-9f2f-013a9676da49","resolution":{"observed_at":"2026-08-07T00:48:31.182343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:31.252154Z","title":"Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:31.252154Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:05a1e7e2a613da8950e1321748b8617ceb7c66159cd3d3e690282f7e8f4ed507","observation_id":"ef186e24-61e5-41cf-bf81-fda06bac4f5c","resolution":{"observed_at":"2026-08-07T00:48:31.252154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:31.366111Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:31.366111Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:ea97d6d772249bb627d53b121c1950788562334890b293fbb57e34d48ae65efd","observation_id":"7f8843cc-3055-4ec6-9c48-159ad1fb97a6","resolution":{"observed_at":"2026-08-07T00:48:31.366111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-07T00:48:31.424586Z","title":"Sgdr: Stochastic gradient descent with warm restarts","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:31.424586Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:53be77fb967c2cfb78600ebafe2e1e08f1333713c617891f7b4ae6b3fedba769","observation_id":"e39b5d73-5718-41e6-9886-f2394b594b86","resolution":{"observed_at":"2026-08-07T00:48:31.424586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T00:48:31.521261Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:31.521261Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:c15f19df14117a61734f441458d4940b2b324b576ff30e89f1cb8f948288174d","observation_id":"a607c0fa-11a5-46ca-8516-3e96c1384d3a","resolution":{"observed_at":"2026-08-07T00:48:31.521261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T00:48:31.608767Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:31.608767Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:112dc824c6ed95090ee2d91a584b27ce4fc4f15582a957e065709d2d22002355","observation_id":"5fb20c4f-02ed-43fd-a417-9700eb54ee93","resolution":{"observed_at":"2026-08-07T00:48:31.608767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-07T00:48:31.688789Z","title":"Feast your eyes: Mixture-of-resolution adaptation for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:31.688789Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:02010a4dea94661def7dac757acf17317e72ca05a0f67d21bb37ba2bd3c44aa8","observation_id":"56555408-5b6c-498d-a63f-ba3f12f10b05","resolution":{"observed_at":"2026-08-07T00:48:31.688789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-07T00:48:31.784648Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:31.784648Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:2d9721b3bd0a108fdfe1e535a992b00a17c92ed2501467b23905c2ce7bd1c679","observation_id":"888b9194-5eee-423a-a6c0-3abbdc2e8561","resolution":{"observed_at":"2026-08-07T00:48:31.784648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:31.859231Z","title":"Infographicvqa","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:31.859231Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:6fa4d97c07d93d37d8fcca853cbfde57087eabb70668b423cb93373c806fff92","observation_id":"3622c02b-b745-4a0a-84e8-765ad3c35cd1","resolution":{"observed_at":"2026-08-07T00:48:31.859231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:36.863934Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"5255e2f9-de5e-4360-b4dc-fdd50c6fd694","year":2021},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:31.955507Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:785a14f0ab41d29bd121d07f1cbe217b0c5e2a9b88d54b4d0c07555784400f97","observation_id":"f2035eb1-a169-47b4-a1c2-e9e7a65c513c","resolution":{"observed_at":"2026-08-07T00:48:36.930932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:36.663968Z","title":"Patch n’ pack: Navit, a vision transformer for any aspect ratio and resolution, 2023","venue":null,"work_id":"c3f0bd96-9f84-4cce-8bfb-aa53e8edc41b","year":2023},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:32.047540Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:4286217a2c46f49bf1cfcd6768a4916293771a3e2034ebd89481f230e371b89f","observation_id":"6a20a55d-df00-4e28-a867-2b132bc3d205","resolution":{"observed_at":"2026-08-07T00:48:36.759217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:36.441284Z","title":"Ovo-bench: How far is your video-llms from real-world online video understanding? In Proceedings of the Computer Vision and Pattern Recognition Conference, pages 18902–18913, 2025","venue":null,"work_id":"0bc318d8-45ec-45c5-948b-589a662d9304","year":2025},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:32.169757Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:16325e6147f3aa9e63be327b8b44208e00acaec86bca6d22f263df19153e7de7","observation_id":"9b0c52fe-66d5-49d3-8796-b11c09c98a05","resolution":{"observed_at":"2026-08-07T00:48:36.557679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:32.297562Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:32.297562Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:6f595c924571de15cad41be508f0d6787c425635a6aed6174eb7687a5581b136","observation_id":"fd369666-9d8e-44d8-a40e-dd555445bd52","resolution":{"observed_at":"2026-08-07T00:48:32.297562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:36.218394Z","title":"When do we not need larger vision models? In European Conference on Computer Vision, pages 444–462","venue":null,"work_id":"ac03867b-40e5-4e19-8558-823c3f8046c9","year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:32.404618Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:f5b21eb3b535dc1edb596b0350e16d69c2790fd9638e0d06e0fe579e1f705a99","observation_id":"396cba8e-2143-49c2-a0a5-5cb1159e68b6","resolution":{"observed_at":"2026-08-07T00:48:36.296805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:32.488516Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:32.488516Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:b55dba33b4c46f6386093c238e167e4a24ac57d2c87f85ae2ce090d6eae22548","observation_id":"7ebac53f-50e3-4040-a501-c1ec785f2b0b","resolution":{"observed_at":"2026-08-07T00:48:32.488516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:32.571426Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:32.571426Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:094cd72c026ae9481fe961b8dde529fee512a88594d742e44e3c0e8b06b8b972","observation_id":"7f22c7c6-e324-451c-bd75-660a10d00b58","resolution":{"observed_at":"2026-08-07T00:48:32.571426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:32.667962Z","title":"Internlm: A multilingual language model with progressively enhanced capabilities, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:32.667962Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:81dde5106b09497961989b6ea39f426901f2b0d4276afd569e652a667b5e5ba5","observation_id":"26a6e65a-bf4a-4826-8a9c-fafbb8a22589","resolution":{"observed_at":"2026-08-07T00:48:32.667962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-07T00:48:32.740707Z","title":"Kimi-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:32.740707Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:1e2718dc537feaab748b1f67cd8d9749b74db07bc4749d5654dc702d91c28a6d","observation_id":"7d899ee3-e8d1-4120-8aae-aebb65305b14","resolution":{"observed_at":"2026-08-07T00:48:32.740707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:32.855555Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:32.855555Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:7d695eeff369bb95dca0bd7cc3562e0c5a41ea7d2a9d846e7d9c772f24eabdeb","observation_id":"d2e9f43c-e693-4959-852e-547fcdf21f5a","resolution":{"observed_at":"2026-08-07T00:48:32.855555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T00:48:32.992231Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:32.992231Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:0a24058bbfa71405313497956da902f2fbb66277f481f38fdced210bbe07da7f","observation_id":"f4b0045e-7682-452e-b341-2d0e1956b838","resolution":{"observed_at":"2026-08-07T00:48:32.992231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T00:48:33.114735Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:33.114735Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:bf742926335b7cc45bdcdb55f1fe1adfa870bd6abffe38f27ca24078d9a3aee1","observation_id":"2cc87ade-6243-4ef1-8afa-2e443bdfbefc","resolution":{"observed_at":"2026-08-07T00:48:33.114735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:35.997888Z","title":"Divide, conquer and combine: A training-free framework for high-resolution image perception in multimodal large language models","venue":null,"work_id":"1cf911de-6564-43fc-9671-9913d2bac752","year":2025},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:33.213010Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:974d2802541f52e98d74707d88772381d68820203b909b092bd3213fc4208408","observation_id":"32f6e633-21d2-455d-a48f-02b01855bc70","resolution":{"observed_at":"2026-08-07T00:48:36.091872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07783","last_updated":"2025-01-14T01:57:41Z","snapshot_observed_at":"2026-08-08T02:31:13.163227Z","submitted_at":"2025-01-14T01:57:41Z","title":"Parameter-Inverted Image Pyramid Networks for Visual Perception and Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07783","snapshot_observed_at":"2026-08-07T00:48:33.338434Z","title":"Parameter-inverted image pyramid networks for visual perception and multimodal understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:33.338434Z"},"links":{"cited_paper":"/paper/2501.07783","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:5ebc30fe64900cdaf1807d9ce64f452189671bc1ee935d465bc585277641dd5d","observation_id":"3b412e13-b0c9-482f-9f09-a2dae75db265","resolution":{"observed_at":"2026-08-07T00:48:33.338434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-07T00:48:33.446924Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:33.446924Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:d2da88c5cb57b684d585d9505af87b777bae836a9745e1c3e5dbc1b4dbac2667","observation_id":"e80137b3-24e5-4535-8511-8cd6d336417a","resolution":{"observed_at":"2026-08-07T00:48:33.446924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T00:48:33.535196Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:33.535196Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:950872667cc7f8f921c228736ccaeb61077b8de8f5e15fcf5f7ee395f6238186","observation_id":"1b8db740-51b7-4499-9a91-3e129af10f55","resolution":{"observed_at":"2026-08-07T00:48:33.535196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05126","last_updated":"2023-10-08T11:33:09Z","snapshot_observed_at":"2026-07-06T16:29:23.853368Z","submitted_at":"2023-10-08T11:33:09Z","title":"UReader: Universal OCR-free Visually-situated Language Understanding with Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05126","snapshot_observed_at":"2026-08-07T00:48:33.654963Z","title":"Ureader: Universal ocr-free visually-situated language understanding with multimodal large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:33.654963Z"},"links":{"cited_paper":"/paper/2310.05126","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:35d24aa64420403e97ef332645cf7842b0b87b17d9bb1567105e5b6e10a75687","observation_id":"5a2db8e0-340b-4ab7-b439-f2c2c86854f8","resolution":{"observed_at":"2026-08-07T00:48:33.654963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-07T00:48:33.765571Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:33.765571Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:23c4e3afb2d3790aefd7c867445ed8d8cffc96b8a2605071009956baf38fc7ac","observation_id":"94d73980-c679-4485-84c2-0af603b7dc22","resolution":{"observed_at":"2026-08-07T00:48:33.765571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09204","last_updated":"2024-04-14T09:48:37Z","snapshot_observed_at":"2026-08-01T15:08:25.999360Z","submitted_at":"2024-04-14T09:48:37Z","title":"TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09204","snapshot_observed_at":"2026-08-07T00:48:33.913826Z","title":"Texthawk: Exploring efficient fine-grained perception of multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:33.913826Z"},"links":{"cited_paper":"/paper/2404.09204","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:78d374458729d8d972d1f5183c6555e31408baee97d106e8ef02ac1e943e2073","observation_id":"bd675666-0726-40a7-ada7-dcd14b2e0ccb","resolution":{"observed_at":"2026-08-07T00:48:33.913826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:34.049608Z","title":"Sigmoid loss for language image pre-training, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:34.049608Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:0c195c84a3c6d416a34434aa081ebe0a0002b966b4a479542fecd1263121252e","observation_id":"727ce860-a44f-441f-8fed-e0382e7af1ba","resolution":{"observed_at":"2026-08-07T00:48:34.049608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09596","last_updated":"2024-12-12T18:58:30Z","snapshot_observed_at":"2026-08-04T06:52:46.954992Z","submitted_at":"2024-12-12T18:58:30Z","title":"InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09596","snapshot_observed_at":"2026-08-07T00:48:34.167998Z","title":"Internlm-xcomposer2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:34.167998Z"},"links":{"cited_paper":"/paper/2412.09596","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:f72243473f1fe1786c7cea0e112a977d073a9b82b4d17cf7ed8b4fb3add654c6","observation_id":"4cef6c13-6340-4263-8359-99ce2afbf1c6","resolution":{"observed_at":"2026-08-07T00:48:34.167998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-06T01:10:51.539456Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-08-07T00:48:34.329669Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:34.329669Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:5c0259cd8d8ab018a710d884ba76d4a6322d5f137e1c381e3c5fc8e3e337a87b","observation_id":"309da78b-8d1e-4153-836e-aa64ee4ed65e","resolution":{"observed_at":"2026-08-07T00:48:34.329669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-07-06T20:09:14.917734Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13871","snapshot_observed_at":"2026-08-07T00:48:34.447271Z","title":"Llava-uhd v2: an mllm integrating high-resolution feature pyramid via hierarchical window transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:34.447271Z"},"links":{"cited_paper":"/paper/2412.13871","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:472b8c1cba0e92fab0c637a0627c34dbbc1a72f4ca2fb010514ca34b564610ad","observation_id":"3d866024-da5b-4073-b695-8bf8b0b3a9ae","resolution":{"observed_at":"2026-08-07T00:48:34.447271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17770","last_updated":"2024-06-27T02:12:28Z","snapshot_observed_at":"2026-08-03T23:51:58.271328Z","submitted_at":"2024-06-25T17:55:11Z","title":"MG-LLaVA: Towards Multi-Granularity Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17770","snapshot_observed_at":"2026-08-07T00:48:34.538261Z","title":"Mg-llava: Towards multi-granularity visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:34.538261Z"},"links":{"cited_paper":"/paper/2406.17770","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:7ee3e530e7d8b8bfe7cd2372adbc8a980530d2961dc8d9fa097957d56a3e0424","observation_id":"80f41d3b-5c2a-4624-901b-1e90b1c58f28","resolution":{"observed_at":"2026-08-07T00:48:34.538261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:35.771119Z","title":"Swift: a scalable lightweight infrastructure for fine-tuning","venue":null,"work_id":"3dacbede-3704-437a-9079-d94cdfe3a77b","year":2025},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:34.646887Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:0ea38b49664e47378ded0573b8b8a23381163ffa841d1a738e8d612b0327ceb7","observation_id":"ebd9d7f2-d8c0-4b09-95a8-8012cb60fa00","resolution":{"observed_at":"2026-08-07T00:48:35.879362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-07T00:48:34.833805Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models.arXiv preprint arXiv:2403.13372, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:34.833805Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:9f9ce33e9fb4c1c6b524e1b18f9eb4fa6d7117eb176b7e69799e675528901d59","observation_id":"d7e63517-4296-4df2-99a0-37102c2a6997","resolution":{"observed_at":"2026-08-07T00:48:34.833805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T00:48:34.911797Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:34.911797Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:1acc1c90c332fbbd7b58737990de9f649f4b73e4435354c837c24870ee532c01","observation_id":"fce9c156-8fc7-47df-8f60-e76731845313","resolution":{"observed_at":"2026-08-07T00:48:34.911797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:35.559123Z","title":"$” or measurement units such as “cm","venue":null,"work_id":"6691cca6-f586-43bc-ba04-4e2e2a6f3773","year":2006},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:35.027792Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:b3ea42653c9f3dc65e05bd468742505f89f9dfbf7bd02e213daa191168c16392","observation_id":"7a882fd8-dd3a-4dfc-ba9a-baa3e1f05b5f","resolution":{"observed_at":"2026-08-07T00:48:35.630405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 3 inbound Pith citation observations for arXiv:2506.12776."}