{"as_of":"2026-08-07T08:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4199688d46903296565a76e9c772eb8e86cba3ce408db8faf8d0a23d1e5c9359","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":37,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:48:30.185030Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-05T04:30:40.718071Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":"2404.16790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-05T04:30:40.718071Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":"892bf722-73fc-4b2e-858d-e1dddc728b4c","year":2024},"citing_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T07:59:32.638758Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2408.13257"},"observation_digest":"sha256:13b1e9ad58c2941693ea5dfcc8f0851c8ddc6b802cf5b346177f115e9d6d4bb2","observation_id":"eb1b67c9-cb8f-4cf3-9bed-c91a0b6ad9eb","resolution":{"observed_at":"2026-05-16T07:59:32.782957Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":"2404.16790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-05T04:30:40.718071Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":"892bf722-73fc-4b2e-858d-e1dddc728b4c","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":125,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:c8fe8c11813baaf9216904034a233bff0e26b8215a8d1a569b2a5963e241d7d2","observation_id":"bf601f4f-cc32-4b4f-884f-34104f92a460","resolution":{"observed_at":"2026-05-10T13:23:58.074856Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":"2404.16790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-05T04:30:40.718071Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":"892bf722-73fc-4b2e-858d-e1dddc728b4c","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:d252c995f2984c1f1cec932c9f7475e77d49ae659b71f218d0c61c741884a362","observation_id":"7fed4a12-5eaf-40e0-bb7f-58a14df4529b","resolution":{"observed_at":"2026-05-17T20:33:26.706356Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":"2404.16790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-05T04:30:40.718071Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":"892bf722-73fc-4b2e-858d-e1dddc728b4c","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:7658e2ca67cd19a5132d507e0ab098d8789eaeb0be82052bfd5a430bdb34da2a","observation_id":"6ffa1d7f-aaee-47f1-9efa-8d2f643abf52","resolution":{"observed_at":"2026-05-10T13:41:08.337965Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-08-07T00:48:30.185030Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:30.185030Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:5969b3dc98801eaae5ff725d536279bb1dbb9cf4e1b3c141915383c9e28d7a98","observation_id":"d0599d4f-1320-4427-957d-93ceb82ad4d3","resolution":{"observed_at":"2026-08-07T00:48:30.185030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-08-06T23:57:23.943515Z","title":"arXiv preprint arXiv:2404.16790 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15681","last_updated":"2026-06-25T14:33:27Z","snapshot_observed_at":"2026-08-06T23:49:22.433306Z","submitted_at":"2025-06-18T17:59:49Z","title":"GenRecal: Generation after Recalibration from Large to Small Vision-Language Models","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:23.943515Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2506.15681"},"observation_digest":"sha256:6237c437594e4e468284d2df606316db570d7334d0d379a06c2f5431ecacd09d","observation_id":"3e46d437-d4fa-4afc-800a-916d564b420e","resolution":{"observed_at":"2026-08-06T23:57:23.943515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-08-06T18:03:13.998784Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09313","last_updated":"2025-07-15T11:48:07Z","snapshot_observed_at":"2026-08-07T00:34:11.228009Z","submitted_at":"2025-07-12T15:11:50Z","title":"ProactiveVideoQA: A Comprehensive Benchmark Evaluating Proactive Interactions in Video Large Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T18:03:13.998784Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2507.09313"},"observation_digest":"sha256:b600eff929149556ab5b5f4ea13ba63c2e22a0c55ff03180e37823e23387e6d0","observation_id":"0f0d8dc1-58fc-44ab-9453-12b949975ae9","resolution":{"observed_at":"2026-08-06T18:03:13.998784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-08-05T23:03:08.173192Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06009","last_updated":"2025-08-08T04:39:16Z","snapshot_observed_at":"2026-08-06T16:03:13.511884Z","submitted_at":"2025-08-08T04:39:16Z","title":"MathReal: We Keep It Real! A Real Scene Benchmark for Evaluating Math Reasoning in Multimodal Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T23:03:08.173192Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2508.06009"},"observation_digest":"sha256:113a73c2417dfc7cb680bbbf846a0ce7e1b099023e86896f70eac4bdb340e71e","observation_id":"e446c60f-acc8-4f68-9a7d-af9aa250ad29","resolution":{"observed_at":"2026-08-05T23:03:08.173192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-08-05T20:18:54.074131Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13186","last_updated":"2025-08-14T13:46:47Z","snapshot_observed_at":"2026-08-07T06:44:51.825047Z","submitted_at":"2025-08-14T13:46:47Z","title":"MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T20:18:54.074131Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2508.13186"},"observation_digest":"sha256:ae818f25a397e9ccd1d4fab543ac59056a7d08da93af76d11075d98faa4effd3","observation_id":"26a51221-4347-4ac5-88fe-8b51366e9d8b","resolution":{"observed_at":"2026-08-05T20:18:54.074131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":"2404.16790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-05T04:30:40.718071Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":"892bf722-73fc-4b2e-858d-e1dddc728b4c","year":2024},"citing_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T11:58:58.660564Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2508.18265"},"observation_digest":"sha256:7a4594a3c04f81c843d17c5e1afcfc71a047f0fc1fbf3fd995469360385d359e","observation_id":"92bbbf6b-91b7-40b3-8fd0-8423d9c3780a","resolution":{"observed_at":"2026-05-10T11:58:59.159584Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-08-05T14:29:24.990122Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21294","last_updated":"2025-08-29T01:23:28Z","snapshot_observed_at":"2026-08-06T11:56:50.801115Z","submitted_at":"2025-08-29T01:23:28Z","title":"BLUEX Revisited: Enhancing Benchmark Coverage with Automatic Captioning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T14:29:24.990122Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2508.21294"},"observation_digest":"sha256:84323e67d10df4154f99d12d6fd170dd2df21e7a06cf9425b1ef3c89187a66a3","observation_id":"93a3a951-c912-49f2-8512-585b1fc62165","resolution":{"observed_at":"2026-08-05T14:29:24.990122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":"2404.16790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-05T04:30:40.718071Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":"892bf722-73fc-4b2e-858d-e1dddc728b4c","year":2024},"citing_paper":{"arxiv_id":"2511.05271","last_updated":"2026-03-11T08:46:41Z","snapshot_observed_at":"2026-07-06T22:35:13.699594Z","submitted_at":"2025-11-07T14:31:20Z","title":"DeepEyesV2: Toward Agentic Multimodal Model","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T05:32:29.266583Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2511.05271"},"observation_digest":"sha256:1d48194154e39f1e60ddea5c2e1a8207e2886e03a68b288eb6bc71dd65f15728","observation_id":"a1b56a09-3792-4a48-af5c-26eeedbf0746","resolution":{"observed_at":"2026-05-16T05:32:29.335668Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":"2404.16790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-05T04:30:40.718071Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":"892bf722-73fc-4b2e-858d-e1dddc728b4c","year":2024},"citing_paper":{"arxiv_id":"2511.14998","last_updated":"2026-04-07T03:13:19Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-19T00:41:14Z","title":"FinCriticalED: A Visual Benchmark for Financial Fact-Level OCR","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T20:19:52.701262Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2511.14998"},"observation_digest":"sha256:f8f09af643fb3ea76f21c8e98f00f15ba31863db5a84010b6186166c4abcdc29","observation_id":"8b799e30-2925-4d39-a890-2e38cc6736f3","resolution":{"observed_at":"2026-05-17T20:20:11.514676Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":"2404.16790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-05T04:30:40.718071Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":"892bf722-73fc-4b2e-858d-e1dddc728b4c","year":2024},"citing_paper":{"arxiv_id":"2601.06803","last_updated":"2026-04-20T09:04:42Z","snapshot_observed_at":"2026-07-06T22:41:19.981014Z","submitted_at":"2026-01-11T08:30:49Z","title":"Forest Before Trees: Latent Superposition for Efficient Visual Reasoning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-16T15:58:03.654150Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2601.06803"},"observation_digest":"sha256:62b8af464ad63b224cd525e9853535b8eadc9a895e619b77b20ed1c726c7b270","observation_id":"d2f8dcbc-db99-45ae-9962-7e9141e36ba9","resolution":{"observed_at":"2026-05-16T16:01:05.178856Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-08-03T06:01:57.751567Z","title":"Seed-bench-2-plus: Benchmarking multimodal large lan- guage models with text-rich visual comprehension","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.00710","last_updated":"2026-06-22T09:09:57Z","snapshot_observed_at":"2026-08-04T21:27:22.990462Z","submitted_at":"2026-01-31T13:11:39Z","title":"Learning More from Less: Unlocking Internal Representations for Benchmark Compression","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T06:01:57.751567Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2602.00710"},"observation_digest":"sha256:f4425da1cba651d5d6de0ddf642045b7870c84916090341c5d8be4c14199cb1a","observation_id":"9ed6f8f7-af64-4e22-8ed1-c90afa19f5ab","resolution":{"observed_at":"2026-08-03T06:01:57.751567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-15T13:43:40.241796Z","title":"Seed-bench-2-plus: Benchmarking multi- modal large language models with text-rich visual compre- hension.arXiv preprint arXiv:2404.16790, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.06577","last_updated":"2026-07-03T04:02:30Z","snapshot_observed_at":"2026-08-02T23:56:12.139811Z","submitted_at":"2026-03-06T18:59:57Z","title":"Omni-Diffusion: Unified Multimodal Understanding and Generation with Masked Discrete Diffusion","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-15T13:43:40.241796Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2603.06577"},"observation_digest":"sha256:18f782e0f2ee3861739184615a0dc2d98600239d49b5dd5f60dbd3236693e318","observation_id":"87b8e29e-dfbe-4f72-81af-26fe4762df7f","resolution":{"observed_at":"2026-07-15T13:43:40.241796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":"2404.16790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-05T04:30:40.718071Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":"892bf722-73fc-4b2e-858d-e1dddc728b4c","year":2024},"citing_paper":{"arxiv_id":"2604.08545","last_updated":"2026-04-09T17:59:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T17:59:57Z","title":"Act Wisely: Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T18:35:21.514502Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2604.08545"},"observation_digest":"sha256:97f7ffce836ad6612dec6389aba7a7ce14c8de85458de1f9a5047e12385f6dff","observation_id":"e40648cf-11bb-41eb-af3e-203b45d85a7d","resolution":{"observed_at":"2026-05-11T00:20:53.805058Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":"2404.16790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-05T04:30:40.718071Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":"892bf722-73fc-4b2e-858d-e1dddc728b4c","year":2024},"citing_paper":{"arxiv_id":"2604.10500","last_updated":"2026-05-12T11:20:49Z","snapshot_observed_at":"2026-07-06T22:59:05.519456Z","submitted_at":"2026-04-12T07:14:30Z","title":"Visual Enhanced Depth Scaling for Multimodal Latent Reasoning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T16:46:36.010169Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2604.10500"},"observation_digest":"sha256:fc5c1382a9a1ef077d09853084065e6e4a44cf9f46ab111843e1ee00c79595fd","observation_id":"3e929891-5d7f-4ccf-9fc2-81d28e7affe8","resolution":{"observed_at":"2026-05-11T08:11:04.284210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":"2404.16790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-05T04:30:40.718071Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":"892bf722-73fc-4b2e-858d-e1dddc728b4c","year":2024},"citing_paper":{"arxiv_id":"2604.10500","last_updated":"2026-05-12T11:20:49Z","snapshot_observed_at":"2026-07-06T22:59:05.519456Z","submitted_at":"2026-04-12T07:14:30Z","title":"Visual Enhanced Depth Scaling for Multimodal Latent Reasoning","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T04:38:06.774877Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2604.10500"},"observation_digest":"sha256:baa179670bcf71581a2275e9f93019d1fc7d9031944d0aaa5ceb07ea5b31789c","observation_id":"4adad9f9-fad9-43a7-8d8e-15396f9d3750","resolution":{"observed_at":"2026-05-12T06:01:26.854067Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":"2404.16790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-05T04:30:40.718071Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":"892bf722-73fc-4b2e-858d-e1dddc728b4c","year":2024},"citing_paper":{"arxiv_id":"2604.10500","last_updated":"2026-05-12T11:20:49Z","snapshot_observed_at":"2026-07-06T22:59:05.519456Z","submitted_at":"2026-04-12T07:14:30Z","title":"Visual Enhanced Depth Scaling for Multimodal Latent Reasoning","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T07:26:59.917150Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2604.10500"},"observation_digest":"sha256:a77e29282e7381c780661863679e114c0e7674061e53bad2ae377cd49abda3f2","observation_id":"4b66fcbb-5d88-4ff7-abdd-cff4dad2ba57","resolution":{"observed_at":"2026-05-13T07:27:29.383248Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":"2404.16790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-05T04:30:40.718071Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":"892bf722-73fc-4b2e-858d-e1dddc728b4c","year":2024},"citing_paper":{"arxiv_id":"2604.15809","last_updated":"2026-04-17T08:07:22Z","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T08:07:22Z","title":"Aligning What Vision-Language Models See and Perceive with Adaptive Information Flow","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T09:02:09.075097Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2604.15809"},"observation_digest":"sha256:86e9c06040d459082a0a92d67497e29e5cdb6c7c360c526f110ef24be4b95948","observation_id":"f451cf29-e6b8-4dd3-a0e5-1b08896683eb","resolution":{"observed_at":"2026-05-10T09:03:24.877582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":"2404.16790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-05T04:30:40.718071Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":"892bf722-73fc-4b2e-858d-e1dddc728b4c","year":2024},"citing_paper":{"arxiv_id":"2604.20328","last_updated":"2026-06-26T07:09:02Z","snapshot_observed_at":"2026-08-02T11:12:35.059224Z","submitted_at":"2026-04-22T08:22:23Z","title":"HyLaR: Hybrid Latent Reasoning with Decoupled Policy Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T01:17:33.668451Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2604.20328"},"observation_digest":"sha256:b78f86107a8f37f0885f4c5ff2d1fc9a38f8713a66677a21c23c59c64a554391","observation_id":"75727995-6101-4240-89b7-3e9c522d0f1c","resolution":{"observed_at":"2026-05-11T13:41:04.248345Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":"2404.16790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-05T04:30:40.718071Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":"892bf722-73fc-4b2e-858d-e1dddc728b4c","year":2024},"citing_paper":{"arxiv_id":"2604.20328","last_updated":"2026-06-26T07:09:02Z","snapshot_observed_at":"2026-08-02T11:12:35.059224Z","submitted_at":"2026-04-22T08:22:23Z","title":"HyLaR: Hybrid Latent Reasoning with Decoupled Policy Optimization","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-05T04:29:52.480873Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2604.20328"},"observation_digest":"sha256:4fb094955991c8c5320f50d6ef989332e5d7cd76917204c13ed0adc8d6e791b1","observation_id":"b0fe877f-5bf5-449c-9e76-3a59ace3047f","resolution":{"observed_at":"2026-07-05T04:30:40.720043Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":"2404.16790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-05T04:30:40.718071Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":"892bf722-73fc-4b2e-858d-e1dddc728b4c","year":2024},"citing_paper":{"arxiv_id":"2605.12960","last_updated":"2026-05-20T10:12:11Z","snapshot_observed_at":"2026-07-06T23:24:37.915639Z","submitted_at":"2026-05-13T03:50:54Z","title":"DiM\\textsuperscript{3}: Bridging Multilingual and Multimodal Models via Direction- and Magnitude-Aware Merging","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-14T20:24:30.679219Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2605.12960"},"observation_digest":"sha256:3f3db10cb3ddd123122eb4e2764cbb2064d2edafd99c13fe06e1b431f8418128","observation_id":"abb05a70-1fbc-41c8-a357-413b306d3a7e","resolution":{"observed_at":"2026-05-14T20:42:58.909922Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":"2404.16790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-05T04:30:40.718071Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":"892bf722-73fc-4b2e-858d-e1dddc728b4c","year":2024},"citing_paper":{"arxiv_id":"2605.12960","last_updated":"2026-05-20T10:12:11Z","snapshot_observed_at":"2026-07-06T23:24:37.915639Z","submitted_at":"2026-05-13T03:50:54Z","title":"DiM\\textsuperscript{3}: Bridging Multilingual and Multimodal Models via Direction- and Magnitude-Aware Merging","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-21T09:12:22.712240Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2605.12960"},"observation_digest":"sha256:a2472bbb2394c6c3e2635593a9f0a6ccd820efb6d4e6ebae37baf1e089a2865e","observation_id":"16914475-6daa-40bb-ad3e-c59290015fe3","resolution":{"observed_at":"2026-05-21T09:14:05.730394Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":"2404.16790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-05T04:30:40.718071Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":"892bf722-73fc-4b2e-858d-e1dddc728b4c","year":2024},"citing_paper":{"arxiv_id":"2605.15300","last_updated":"2026-05-14T18:14:15Z","snapshot_observed_at":"2026-07-06T23:26:37.362117Z","submitted_at":"2026-05-14T18:14:15Z","title":"Deep Pre-Alignment for VLMs","version":1},"reference_index":146,"source":"arxiv_source","source_observed_at":"2026-05-19T16:26:41.094936Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2605.15300"},"observation_digest":"sha256:dfe7619b4d3d1a6d6c85bb9ff361058c98b1311aba9874b6ec1ecf975c193e16","observation_id":"579364dd-983f-4c76-bfd3-ebb0c2944b74","resolution":{"observed_at":"2026-05-19T16:27:39.577374Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":"2404.16790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-05T04:30:40.718071Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":"892bf722-73fc-4b2e-858d-e1dddc728b4c","year":2024},"citing_paper":{"arxiv_id":"2605.15951","last_updated":"2026-05-15T13:41:41Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T13:41:41Z","title":"From Failure to Feedback: Group Revision Unlocks Hard Cases in Object-Level Grounding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T18:39:11.904941Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2605.15951"},"observation_digest":"sha256:ee40bf3a566b99c470b7a8d2a5ea6a811130f3a06e65b0ab591346b9e0a4e8b1","observation_id":"efcc01c1-daba-4837-90d9-1bdce7d19ce4","resolution":{"observed_at":"2026-05-20T18:43:38.878107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":"2404.16790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-05T04:30:40.718071Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":"892bf722-73fc-4b2e-858d-e1dddc728b4c","year":2024},"citing_paper":{"arxiv_id":"2606.07861","last_updated":"2026-06-05T21:49:34Z","snapshot_observed_at":"2026-08-02T02:56:55.871904Z","submitted_at":"2026-06-05T21:49:34Z","title":"The Last Visible Pixel: Probing Fine-Scale Perception in Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T21:58:53.702009Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2606.07861"},"observation_digest":"sha256:d111d1922821109f2de8c2f93327ab83f77e9378284a968f215357e0335e4300","observation_id":"46758ddf-3d42-469b-872d-32c4c5cb52da","resolution":{"observed_at":"2026-07-02T17:37:14.447465Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":"2404.16790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-05T04:30:40.718071Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":"892bf722-73fc-4b2e-858d-e1dddc728b4c","year":2024},"citing_paper":{"arxiv_id":"2606.09393","last_updated":"2026-06-08T12:09:20Z","snapshot_observed_at":"2026-07-06T23:48:44.159537Z","submitted_at":"2026-06-08T12:09:20Z","title":"CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T17:21:38.543724Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2606.09393"},"observation_digest":"sha256:0a7011bb43b65d0d4cdd1f1f054032faa114d96f9d32f161792fa271556b5e3e","observation_id":"0ecaf041-da59-4b17-bf3e-18d4eb31c305","resolution":{"observed_at":"2026-07-03T00:17:29.039683Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":"2404.16790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-05T04:30:40.718071Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":"892bf722-73fc-4b2e-858d-e1dddc728b4c","year":2024},"citing_paper":{"arxiv_id":"2606.21734","last_updated":"2026-06-19T20:43:49Z","snapshot_observed_at":"2026-08-05T18:05:51.515234Z","submitted_at":"2026-06-19T20:43:49Z","title":"HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning","version":1},"reference_index":171,"source":"arxiv_source","source_observed_at":"2026-06-26T14:19:53.450263Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2606.21734"},"observation_digest":"sha256:71db6420e312c9a89e68ce6ced43d51fa1f3b440d8492bc76354add7a5542cb4","observation_id":"929228b3-17f2-4f93-a933-9619e559e750","resolution":{"observed_at":"2026-07-04T06:39:37.641668Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":"2404.16790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-05T04:30:40.718071Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":"892bf722-73fc-4b2e-858d-e1dddc728b4c","year":2024},"citing_paper":{"arxiv_id":"2606.24602","last_updated":"2026-06-23T14:03:56Z","snapshot_observed_at":"2026-07-06T23:59:08.580746Z","submitted_at":"2026-06-23T14:03:56Z","title":"ViTexQA: A Multi-Frame Temporal Perception Dataset for Video Text Question Answering","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T00:24:20.208132Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2606.24602"},"observation_digest":"sha256:db5b269ccc94c77770b669deb0cfd5aadeeb5dcbf7612d41b0ffda258bf265da","observation_id":"7c4026ce-6994-4e23-8df0-612519f719b0","resolution":{"observed_at":"2026-07-04T16:39:57.614558Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":"2404.16790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-05T04:30:40.718071Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":"892bf722-73fc-4b2e-858d-e1dddc728b4c","year":2024},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-06-30T20:49:34Z","snapshot_observed_at":"2026-08-02T23:02:11.703134Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":1},"reference_index":149,"source":"pdf_text","source_observed_at":"2026-06-30T01:16:16.834861Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:de8d8c00c6f4973393780912363f6b84fae59839865d07af5960e6fef39efd4e","observation_id":"238a0bfb-d25a-41b8-90ea-c3601466b7c3","resolution":{"observed_at":"2026-07-01T15:45:47.731258Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":"2404.16790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-05T04:30:40.718071Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":"892bf722-73fc-4b2e-858d-e1dddc728b4c","year":2024},"citing_paper":{"arxiv_id":"2606.28551","last_updated":"2026-06-30T20:49:34Z","snapshot_observed_at":"2026-08-02T23:02:11.703134Z","submitted_at":"2026-06-26T19:11:29Z","title":"DataComp-VLM: Improved Open Datasets for Vision-Language Models","version":2},"reference_index":149,"source":"pdf_text","source_observed_at":"2026-07-02T21:10:10.548489Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2606.28551"},"observation_digest":"sha256:e273dc1b0154b516e6ea27bfbae563989ce7bc8e361e4f652407e9035c8be7c2","observation_id":"8e6216d3-e66c-4f9a-9e92-8eb022bc2b9a","resolution":{"observed_at":"2026-07-02T21:17:24.162441Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":"2404.16790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-05T04:30:40.718071Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":"892bf722-73fc-4b2e-858d-e1dddc728b4c","year":2024},"citing_paper":{"arxiv_id":"2607.00465","last_updated":"2026-07-01T05:34:07Z","snapshot_observed_at":"2026-08-02T15:57:39.914387Z","submitted_at":"2026-07-01T05:34:07Z","title":"StochasT: Learning with Stochastic Turn Depth for Visual Instruction Tuning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-02T15:04:18.880016Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2607.00465"},"observation_digest":"sha256:4092f62d59abccc7c627b845781952af7dd12c45d7db430e1cbfbf44685825b7","observation_id":"73ee3721-3cd8-460a-a73f-6e71170c2f86","resolution":{"observed_at":"2026-07-02T15:07:03.920797Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-08-02T01:58:01.879688Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension.arXiv preprint arXiv:2404.16790, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14499","last_updated":"2026-07-16T02:25:03Z","snapshot_observed_at":"2026-08-04T11:10:46.858246Z","submitted_at":"2026-07-16T02:25:03Z","title":"Contextualized Evaluation of Vision Language Models through Dynamic, Multi-turn Interactions","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T01:58:01.879688Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2607.14499"},"observation_digest":"sha256:f7a447cacfb0fbe8bc4a8c0ea86d530054a967990bd9048b6ba7f3884fb3c72d","observation_id":"6c79f30b-a7c0-4f88-904a-6c8d6a29cdf5","resolution":{"observed_at":"2026-08-02T01:58:01.879688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-31T06:20:14.200481Z","title":"SEED-Bench-2- Plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24904","last_updated":"2026-07-27T17:59:53Z","snapshot_observed_at":"2026-08-07T06:47:24.083796Z","submitted_at":"2026-07-27T17:59:53Z","title":"Mage-VL: An Efficient Codec-Native Streaming Multimodal Foundation Model","version":1},"reference_index":143,"source":"pdf_text","source_observed_at":"2026-07-31T06:20:14.200481Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2607.24904"},"observation_digest":"sha256:b6c07bc12f30cf1b812cc6114f56a69c23aec95f4698dccff73011e956de534b","observation_id":"b8adfbc4-0697-4892-8d1e-9bce6b39468f","resolution":{"observed_at":"2026-07-31T06:20:14.200481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-08-05T04:16:08.312878Z","title":"arXiv preprint arXiv:2404.16790 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04010","last_updated":"2026-08-04T17:59:58Z","snapshot_observed_at":"2026-08-07T07:52:21.745918Z","submitted_at":"2026-08-04T17:59:58Z","title":"ParVL: Parallel Scaling and Expandable Compute Allocation for Multimodal LLMs","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-05T04:16:08.312878Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2608.04010"},"observation_digest":"sha256:c7a5fa46732f7bebc63f9c3abb233381b4e1973c00e71aa8dac6054c64dedd52","observation_id":"d6899fd5-23ac-494e-848d-f0574a043eac","resolution":{"observed_at":"2026-08-05T04:16:08.312878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2404.16790/citation-record","integrity":"/paper/2404.16790/integrity","json":"/paper/2404.16790/citation-record.json","paper":"/paper/2404.16790"},"outbound":[],"paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 37 inbound Pith citation observations for arXiv:2404.16790."}