{"as_of":"2026-08-11T17:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2e099b6aaf3b8c3ec05d73d1d275c29c29c0ba269b758fa9dc213ad08f592194","coverage":[{"denominator":154,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T13:41:07.991012Z","state":"measured"},{"denominator":200,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":200,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":746,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:17:26.566560Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":6,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-08-08T01:58:42.644918Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"reference_index":124,"source":"pdf_text","source_observed_at":"2026-05-16T11:39:22.340737Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2501.04001"},"observation_digest":"sha256:524d6197dfe612e587079e98cca28ef4432a422af3f2067e8f0c026edcbc5f21","observation_id":"05f338c6-f496-4ed5-a922-455affbcbc31","resolution":{"observed_at":"2026-05-16T11:39:22.581047Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-10T20:17:26.566560Z","title":"InternVL3: ex- ploring advanced training and test-time recipes for open-source multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.08983","last_updated":"2025-09-01T12:11:42Z","snapshot_observed_at":"2026-08-10T20:10:38.838972Z","submitted_at":"2025-01-15T17:59:56Z","title":"Compositional Generative Model of Unbounded 4D Cities","version":4},"reference_index":123,"source":"pdf_text","source_observed_at":"2026-08-10T20:17:26.566560Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2501.08983"},"observation_digest":"sha256:4aea0ad50144f087cbd6536b24ca0bcda3c327932f560e14c574808be91f01b6","observation_id":"03d07df6-49f5-4699-b8b3-d34a45cb49ec","resolution":{"observed_at":"2026-08-10T20:17:26.566560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2504.13181","last_updated":"2025-04-28T18:01:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T17:59:57Z","title":"Perception Encoder: The best visual embeddings are not at the output of the network","version":2},"reference_index":168,"source":"pdf_text","source_observed_at":"2026-05-13T22:21:15.681336Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2504.13181"},"observation_digest":"sha256:27e63522c4ab4c729e49a487fe6e08b53eee0d9576320f32e99d0bf08d533361","observation_id":"b17fde1e-7c7c-4d82-bd6b-44a9f5314801","resolution":{"observed_at":"2026-05-13T22:21:15.829279Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2504.14988","last_updated":"2026-04-30T15:12:07Z","snapshot_observed_at":"2026-08-03T01:40:56.706749Z","submitted_at":"2025-04-21T09:30:41Z","title":"Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-22T18:26:12.597756Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2504.14988"},"observation_digest":"sha256:55caf11ff7f17b922160f198a6e8b580a0d89923052afc26ea8ce27379707c03","observation_id":"f5318b83-0017-4777-817a-fd88113da0cd","resolution":{"observed_at":"2026-05-22T18:26:55.270297Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2505.14362","last_updated":"2026-03-01T04:59:56Z","snapshot_observed_at":"2026-08-02T12:23:34.946873Z","submitted_at":"2025-05-20T13:48:11Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-11T14:42:56.565621Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.14362"},"observation_digest":"sha256:7e9c6a0c93a67a64a9e8d00a1894e22d2d523c7976c9a8353639b314e6eeeee2","observation_id":"1a098fb1-db94-4d62-9439-b3f194309c96","resolution":{"observed_at":"2026-05-11T14:42:56.781289Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T15:36:28.095327Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models.arXiv e-prints, art","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-10T19:06:19.246966Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:28.095327Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:52bb23b508af140fc285f5056f7a1529f41197cb053ce6ad2a573fb0d318d851","observation_id":"cda1f626-b060-455b-89a8-a02f3d16b44e","resolution":{"observed_at":"2026-08-07T15:36:28.095327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T15:34:44.591263Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14640","last_updated":"2025-05-20T17:26:32Z","snapshot_observed_at":"2026-08-10T08:26:12.719387Z","submitted_at":"2025-05-20T17:26:32Z","title":"VideoEval-Pro: Robust and Realistic Long Video Understanding Evaluation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:44.591263Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.14640"},"observation_digest":"sha256:1af3eceddcc1359b7a267ab5814e6343737bac0a4e92a602c7aec26de4ed32b3","observation_id":"e2f50624-c532-4090-9107-576c2a735bad","resolution":{"observed_at":"2026-08-07T15:34:44.591263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T15:34:55.921584Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14682","last_updated":"2025-05-20T17:59:26Z","snapshot_observed_at":"2026-08-07T20:35:28.075030Z","submitted_at":"2025-05-20T17:59:26Z","title":"UniGen: Enhanced Training & Test-Time Strategies for Unified Multimodal Understanding and Generation","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:55.921584Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.14682"},"observation_digest":"sha256:228b0fd75db276368307f226be96e234ce78bcf1d0c927f1731f1effd22f99cc","observation_id":"0e74cc5c-5dd6-4746-92a7-02b407ac0979","resolution":{"observed_at":"2026-08-07T15:34:55.921584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2505.15616","last_updated":"2026-05-13T12:54:20Z","snapshot_observed_at":"2026-08-03T01:38:16.643054Z","submitted_at":"2025-05-21T15:06:59Z","title":"LENS: Multi-level Evaluation of Multimodal Reasoning with Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T13:47:51.436258Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.15616"},"observation_digest":"sha256:7f92148e64d0114f22305350db822a4091c61eb3471c0fbc06a22e8029eb9072","observation_id":"b9921659-b815-4ea3-a041-8092867677ee","resolution":{"observed_at":"2026-05-22T13:51:37.695934Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T15:15:42.305127Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.305127Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:f4bbef362dc89d8f72fb59d25927f8553838b16bbe083a0a3c41b3ea9a5bfb95","observation_id":"f67027c9-4458-48db-9a08-8c0e0be4206f","resolution":{"observed_at":"2026-08-07T15:15:42.305127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2505.15879","last_updated":"2026-05-09T18:01:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:54:49Z","title":"GRIT: Teaching MLLMs to Think with Images","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T13:29:47.529564Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.15879"},"observation_digest":"sha256:4f274eeb75bd32eb8d9020d1daab92320490cd0d7d402df5e072528f29a36589","observation_id":"0994b7bf-7d19-4bf0-8e6a-0ce65e4607dc","resolution":{"observed_at":"2026-05-22T13:31:36.139144Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T15:14:55.105060Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15929","last_updated":"2025-05-29T17:59:14Z","snapshot_observed_at":"2026-08-09T05:39:52.681912Z","submitted_at":"2025-05-21T18:33:50Z","title":"PhyX: Does Your Model Have the \"Wits\" for Physical Reasoning?","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:14:55.105060Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.15929"},"observation_digest":"sha256:862140515908112221ecf789c9d284069fbb55dd080d813c7bcffc543d1ae949","observation_id":"3ab6f159-b65f-4550-b531-c09f3494b5ba","resolution":{"observed_at":"2026-08-07T15:14:55.105060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T15:09:02.863981Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:02.863981Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:c3c1960409e0169b325f65cdba7192f643b842c6dc7d4d747cb52d2925e91869","observation_id":"c3b24cbf-3b98-4fd6-9d57-9e382a28dd35","resolution":{"observed_at":"2026-08-07T15:09:02.863981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T15:02:27.349532Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-09T20:20:59.205626Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:27.349532Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:304f64bd7694bd6391572c1414ceb49c9e77207eb9cf799fec64ddf0e5cc2e6e","observation_id":"75822fd1-1674-4244-a18f-b958e6bb4628","resolution":{"observed_at":"2026-08-07T15:02:27.349532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T14:58:44.144189Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16770","last_updated":"2025-05-23T15:40:22Z","snapshot_observed_at":"2026-08-09T02:01:21.817942Z","submitted_at":"2025-05-22T15:11:57Z","title":"RBench-V: A Primary Assessment for Visual Reasoning Models with Multi-modal Outputs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:44.144189Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.16770"},"observation_digest":"sha256:7dc6142db7633acaade15de5813ea45a8a7309e86ce6dd29da4370500535bb55","observation_id":"eb45cb7a-5c9c-48e7-83b4-dc1a04123dcb","resolution":{"observed_at":"2026-08-07T14:58:44.144189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T14:59:40.415254Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16839","last_updated":"2026-07-15T22:41:27Z","snapshot_observed_at":"2026-08-08T00:51:08.095497Z","submitted_at":"2025-05-22T16:07:12Z","title":"LaViDa: A Large Diffusion Language Model for Multimodal Understanding","version":4},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T14:59:40.415254Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.16839"},"observation_digest":"sha256:56f5449c3e8f8262507ea0e871d8b3a70cf20db0e69f4d86c52ce62439cd5136","observation_id":"04e31361-0eda-4b64-b7f2-0025f048c250","resolution":{"observed_at":"2026-08-07T14:59:40.415254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T14:55:31.877954Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:31.877954Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:cc65c6abb6e0ddf5accf86832d73443501c375b79742df810f2a951abbcd232d","observation_id":"9886c18f-904d-4ce6-b7fa-422291e00bf2","resolution":{"observed_at":"2026-08-07T14:55:31.877954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2505.17012","last_updated":"2026-04-13T12:33:41Z","snapshot_observed_at":"2026-07-06T21:28:43.610849Z","submitted_at":"2025-05-22T17:59:03Z","title":"SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence","version":3},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-05-22T13:07:11.548885Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.17012"},"observation_digest":"sha256:09f3b2caf87b2e927585d9fe1b67cae50b514b5474b1eacdae667eebae7fc165","observation_id":"8563c017-fdd0-409c-9824-a7e4b58df3d9","resolution":{"observed_at":"2026-05-22T13:11:35.695264Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T14:57:21.933270Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17163","last_updated":"2026-05-26T01:50:12Z","snapshot_observed_at":"2026-08-07T14:52:59.748689Z","submitted_at":"2025-05-22T15:25:14Z","title":"OCR-Reasoning Benchmark: Unveiling the True Capabilities of MLLMs in Complex Text-Rich Image Reasoning","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:21.933270Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.17163"},"observation_digest":"sha256:c05afd0c48fca64daee2f334b6818c12215b627aef41351394de21cfed974303","observation_id":"a11578a7-f8a2-47b0-86d1-823c5a417955","resolution":{"observed_at":"2026-08-07T14:57:21.933270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T14:51:18.223323Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17399","last_updated":"2025-05-26T11:15:36Z","snapshot_observed_at":"2026-08-11T17:20:12.592973Z","submitted_at":"2025-05-23T02:16:11Z","title":"FullFront: Benchmarking MLLMs Across the Full Front-End Engineering Workflow","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:18.223323Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.17399"},"observation_digest":"sha256:2b130fbb71541203545acb3d33771cbf3285d313458c53f620df592c2c0b1555","observation_id":"239bc833-9097-451a-a98d-d3e16827e969","resolution":{"observed_at":"2026-08-07T14:51:18.223323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T14:51:44.389472Z","title":"self-supervised learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-10T04:07:34.034332Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:44.389472Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:7eb034544694230e52be4f75d557369e44ba8d72727521fa17f195d5f11745b3","observation_id":"316e5b31-197b-41f0-a4a1-8706a1e0a564","resolution":{"observed_at":"2026-08-07T14:51:44.389472Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T14:46:06.041945Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17654","last_updated":"2026-05-27T08:26:10Z","snapshot_observed_at":"2026-08-07T14:40:44.563063Z","submitted_at":"2025-05-23T09:18:01Z","title":"EVADE-Bench: Multimodal Benchmark for Evaluating and Enhancing Evasive Content Detection","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:06.041945Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.17654"},"observation_digest":"sha256:31b1c18c7a32cf5ce8ed684178d10d58ae0bb21a60cb1a070a9f07e9938d9650","observation_id":"904ae12a-c11c-4182-9fbe-504249297311","resolution":{"observed_at":"2026-08-07T14:46:06.041945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T14:34:52.342099Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:52.342099Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:43a69ef7cefd87ba452304df2fadcbb199a36836a42eec5852f4d6042845bcfc","observation_id":"f8f34cbe-3bb1-4204-aef1-f334d06d5fc7","resolution":{"observed_at":"2026-08-07T14:34:52.342099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T14:30:21.513272Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:21.513272Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:99b71898297bebcac7b1565eafb3695c92c06ab547bebe3ee62c849b677c9b81","observation_id":"1f977bd7-d0b0-4f54-af21-f70a07258c6f","resolution":{"observed_at":"2026-08-07T14:30:21.513272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T14:16:54.741327Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:54.741327Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:2862daa315c29fbc0ac2e14366bee5d6aef625048a1a4c9ea9485d878930a2b2","observation_id":"68370baa-f6fd-4626-9c4e-34af8b7f9cf4","resolution":{"observed_at":"2026-08-07T14:16:54.741327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T14:14:47.630465Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-09T09:30:25.697403Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":118,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:47.630465Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:409dcefeb470999e41fc9fa8b7377535b63387d06f914f9b344f46a7f92bed53","observation_id":"7d815d66-67ce-4078-a33f-b49ae13ce16b","resolution":{"observed_at":"2026-08-07T14:14:47.630465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T14:09:16.421330Z","title":"Animals Hurt Human\\","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:16.421330Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:847318b259d0b71974f62a11644c0c4281349967d7378f8802a684b1d62c7a21","observation_id":"f059adeb-1584-42cc-8b4d-52f63e67b90f","resolution":{"observed_at":"2026-08-07T14:09:16.421330Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T14:01:25.854052Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-11T10:17:57.920761Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:25.854052Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:37b29cffaa8e1207fd9ad6f83bb130cebf689d5bf8c82c268284b216088467c3","observation_id":"bbe0ee83-2b7a-4ec4-b01a-5d9eb00677f7","resolution":{"observed_at":"2026-08-07T14:01:25.854052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T13:50:34.081389Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20728","last_updated":"2025-08-26T03:25:38Z","snapshot_observed_at":"2026-08-08T14:42:44.924849Z","submitted_at":"2025-05-27T05:17:41Z","title":"Jigsaw-Puzzles: From Seeing to Understanding to Reasoning in Vision-Language Models","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T13:50:34.081389Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.20728"},"observation_digest":"sha256:9548478bf635bd689649a9135fe4250c9ae97314c5b58dd181bfbf4818799175","observation_id":"d9652d4f-5803-404f-bfbe-04cbc5d6017a","resolution":{"observed_at":"2026-08-07T13:50:34.081389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T13:36:03.052140Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21327","last_updated":"2025-05-27T15:23:23Z","snapshot_observed_at":"2026-08-08T22:42:35.699276Z","submitted_at":"2025-05-27T15:23:23Z","title":"MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T13:36:03.052140Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.21327"},"observation_digest":"sha256:b588f846475ae5b8d21e70c7481eb23733412591fcf09bf61cf4e8fbe9166508","observation_id":"d5188b38-781a-443d-9b52-42126a12fce0","resolution":{"observed_at":"2026-08-07T13:36:03.052140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2505.21374","last_updated":"2025-05-27T16:05:01Z","snapshot_observed_at":"2026-08-06T04:32:21.352745Z","submitted_at":"2025-05-27T16:05:01Z","title":"Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-17T05:40:55.944288Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.21374"},"observation_digest":"sha256:98aeab355f4ee0cadf06c4cc68195fef36851a43d9728381b6ef0d725465f0cb","observation_id":"779aaedc-eb90-4265-a5f1-bf46bf209fca","resolution":{"observed_at":"2026-05-17T05:40:56.011410Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T13:33:58.230319Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21465","last_updated":"2025-05-27T17:36:23Z","snapshot_observed_at":"2026-08-07T16:43:25.522882Z","submitted_at":"2025-05-27T17:36:23Z","title":"ID-Align: RoPE-Conscious Position Remapping for Dynamic High-Resolution Adaptation in Vision-Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:58.230319Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.21465"},"observation_digest":"sha256:7d387fd925d446d088e68e0d6ce637f95804a3dd6f929a60d1f6e5e97135556f","observation_id":"281c2a70-5c47-4125-9504-d3bffeb7b64b","resolution":{"observed_at":"2026-08-07T13:33:58.230319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T13:34:16.540169Z","title":"action_desc","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21496","last_updated":"2025-05-27T17:58:06Z","snapshot_observed_at":"2026-08-08T15:12:37.593143Z","submitted_at":"2025-05-27T17:58:06Z","title":"UI-Genie: A Self-Improving Approach for Iteratively Boosting MLLM-based Mobile GUI Agents","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:34:16.540169Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.21496"},"observation_digest":"sha256:bdd1aac5fade31e5c07de7ffcbe485c7e6f2fca3512e5c680d8dec83015f74f9","observation_id":"c0c5c59e-0ee5-4ba8-94f0-7349e1a74c8a","resolution":{"observed_at":"2026-08-07T13:34:16.540169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T13:06:22.456572Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22663","last_updated":"2025-07-01T17:38:27Z","snapshot_observed_at":"2026-08-09T07:19:28.132692Z","submitted_at":"2025-05-28T17:59:57Z","title":"Training Free Stylized Abstraction","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:06:22.456572Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.22663"},"observation_digest":"sha256:40ebe8b5ae620ef71c579843925d9abcecb683df01e2e6be9df5a5b1dfc8ad48","observation_id":"6e800659-f0a3-4137-b139-2382ac133c49","resolution":{"observed_at":"2026-08-07T13:06:22.456572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T12:45:46.117617Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:46.117617Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:00c9d05c43c2e3f833b779c5b5fd7405616be2866a48ee266eaec5f70f9b4165","observation_id":"8046bc62-217f-40d9-83c9-4fe1946366d6","resolution":{"observed_at":"2026-08-07T12:45:46.117617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T12:40:47.180213Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:47.180213Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:f4e24810679256d3f784b7e79ce8df059c16f76d1de46bb32713e28e85917f5f","observation_id":"7c83732d-0799-4372-a423-e1939376ee40","resolution":{"observed_at":"2026-08-07T12:40:47.180213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T12:42:28.211056Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24073","last_updated":"2025-08-26T16:42:37Z","snapshot_observed_at":"2026-08-07T21:48:31.035838Z","submitted_at":"2025-05-29T23:32:03Z","title":"mRAG: Elucidating the Design Space of Multi-modal Retrieval-Augmented Generation","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T12:42:28.211056Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.24073"},"observation_digest":"sha256:7bc4deaa92fa6b32297508cfb264d909c69462102e3091802dd396ee54df5bed","observation_id":"d0c1c0d0-f2ce-4a7e-8433-21199a2041fd","resolution":{"observed_at":"2026-08-07T12:42:28.211056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T12:37:50.749824Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-09T00:48:58.339159Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:50.749824Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:6af9cd8e4751d24c8fcbef59b748a22c12d042abf748fa214aed4a693730ff7e","observation_id":"ea093f35-2b5b-40ce-9134-c4dd340489b8","resolution":{"observed_at":"2026-08-07T12:37:50.749824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T12:36:18.458818Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:18.458818Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:d8dd6ba3ddd7c42b09f25325ba119b437a4d348b9546b6561ea019ff0f1f1c49","observation_id":"01b07d1d-4d82-4309-8863-116f46653402","resolution":{"observed_at":"2026-08-07T12:36:18.458818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T12:33:56.192143Z","title":"InternVL3: exploring advanced training and test- time recipes for open-source multimodal models, (Technical Report),","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24214","last_updated":"2025-05-30T04:53:55Z","snapshot_observed_at":"2026-08-07T12:27:14.242511Z","submitted_at":"2025-05-30T04:53:55Z","title":"Benchmarking Foundation Models for Zero-Shot Biometric Tasks","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:33:56.192143Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.24214"},"observation_digest":"sha256:ce8f38a09e1d57281b7fb7ee2f76c58aa0bfd634728074505a9236c471c6d886","observation_id":"393bbb5a-41ba-444d-872b-ce64e739b817","resolution":{"observed_at":"2026-08-07T12:33:56.192143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T12:18:35.370202Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24787","last_updated":"2025-05-30T16:48:14Z","snapshot_observed_at":"2026-08-07T15:30:21.145991Z","submitted_at":"2025-05-30T16:48:14Z","title":"Draw ALL Your Imagine: A Holistic Benchmark and Agent Framework for Complex Instruction-based Image Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:35.370202Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.24787"},"observation_digest":"sha256:40c1339b31ebad0e8f6fc5c957dee3d245dcafef0cdc95b20564884df2f4b1b3","observation_id":"b3ee151d-61fb-4225-b0fd-cf459e23e674","resolution":{"observed_at":"2026-08-07T12:18:35.370202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T12:18:57.509715Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24876","last_updated":"2026-05-24T03:59:43Z","snapshot_observed_at":"2026-08-07T12:10:13.725980Z","submitted_at":"2025-05-30T17:59:53Z","title":"Agent-X: Evaluating Deep Multimodal Reasoning in Vision-Centric Agentic Tasks","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:57.509715Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.24876"},"observation_digest":"sha256:11c6f8c747ddff4512cbfd66eff2086036bef9504bd19f366b4390d31cd0c67a","observation_id":"fe697fdf-c8d0-45cd-88c1-95da879b32b7","resolution":{"observed_at":"2026-08-07T12:18:57.509715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T12:01:05.706419Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00855","last_updated":"2025-06-01T06:28:36Z","snapshot_observed_at":"2026-08-09T20:43:19.513638Z","submitted_at":"2025-06-01T06:28:36Z","title":"MedBookVQA: A Systematic and Comprehensive Medical Benchmark Derived from Open-Access Book","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:05.706419Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.00855"},"observation_digest":"sha256:e2eb03b60aba8385346c64e6872112cce6448f1ad21f93974438b926e71ffb28","observation_id":"2e645ceb-1ac1-4c26-88ae-c40d0630f781","resolution":{"observed_at":"2026-08-07T12:01:05.706419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T11:59:56.340485Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00893","last_updated":"2025-08-02T10:06:31Z","snapshot_observed_at":"2026-08-10T05:11:31.269138Z","submitted_at":"2025-06-01T08:26:34Z","title":"Affordance Benchmark for MLLMs","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:56.340485Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.00893"},"observation_digest":"sha256:d0ef930ad3da078833eca523dbaff9d88978c9bd74e457e4ac51288255cf7934","observation_id":"dabf967d-32cf-406a-95d9-51cdf832db31","resolution":{"observed_at":"2026-08-07T11:59:56.340485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T11:55:14.847482Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01078","last_updated":"2025-06-01T16:28:26Z","snapshot_observed_at":"2026-08-08T00:05:34.569025Z","submitted_at":"2025-06-01T16:28:26Z","title":"GThinker: Towards General Multimodal Reasoning via Cue-Guided Rethinking","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T11:55:14.847482Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.01078"},"observation_digest":"sha256:2117dc68bf5b5271cab79fc0656e2adfda68dc1bae2b240af4b58a3af8ea897d","observation_id":"ab1a015a-c659-4ae2-979b-d101bc05bf37","resolution":{"observed_at":"2026-08-07T11:55:14.847482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T11:51:30.225766Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01274","last_updated":"2026-06-11T17:06:50Z","snapshot_observed_at":"2026-08-10T04:03:56.011290Z","submitted_at":"2025-06-02T03:08:07Z","title":"ReFoCUS: Reinforcement-guided Frame Optimization for Contextual Understanding","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:30.225766Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.01274"},"observation_digest":"sha256:c197d85f12ceba709f4b5ea0ca7f7f050dbce505983afc16d58b3684baa97252","observation_id":"6242eb91-4f6f-497f-9b41-262e710bdd93","resolution":{"observed_at":"2026-08-07T11:51:30.225766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T11:40:57.963146Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:57.963146Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:191b98e54144b76dc0108f4aac30647370b6e127397e7368ccdd5ee006ec5341","observation_id":"24a627c5-91d6-4e12-86c9-66262efea867","resolution":{"observed_at":"2026-08-07T11:40:57.963146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T13:18:48.190114Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02020","last_updated":"2025-05-28T11:18:19Z","snapshot_observed_at":"2026-08-11T05:40:46.857278Z","submitted_at":"2025-05-28T11:18:19Z","title":"Improve Multi-Modal Embedding Learning via Explicit Hard Negative Gradient Amplifying","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:18:48.190114Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.02020"},"observation_digest":"sha256:7fa4c2a4d75acd3c193ce4a734a31687839664a4b4443860b3c8ee6ca9d54700","observation_id":"56948934-2ff3-42cf-864d-e24574e7f022","resolution":{"observed_at":"2026-08-07T13:18:48.190114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2506.02387","last_updated":"2026-04-13T08:26:12Z","snapshot_observed_at":"2026-08-11T01:40:24.202082Z","submitted_at":"2025-06-03T02:57:38Z","title":"VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-19T11:57:08.314088Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.02387"},"observation_digest":"sha256:1f459e51d983334b03110d152cc8a0a25670c51f5eb4ccb62350cddebfd9aa38","observation_id":"8c76ed4c-6170-46ba-b043-abac5c72b6c3","resolution":{"observed_at":"2026-05-19T11:57:16.295831Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T11:26:43.461381Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multi- modal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-11T01:58:14.310541Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:43.461381Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:290eb1177d19e894ebdcb9850eb19cfcbe1591a01cc4d617640937e7f907900f","observation_id":"ee514e3a-760c-49f7-8dfb-3f8be28bc8ec","resolution":{"observed_at":"2026-08-07T11:26:43.461381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T11:11:54.781412Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03139","last_updated":"2025-06-03T17:58:57Z","snapshot_observed_at":"2026-08-09T23:25:43.123599Z","submitted_at":"2025-06-03T17:58:57Z","title":"SVGenius: Benchmarking LLMs in SVG Understanding, Editing and Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T11:11:54.781412Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.03139"},"observation_digest":"sha256:5485f5f2ccd1d75302c85d5ebc9732e7487bc40a7b6d1e12a28d640d1476c6df","observation_id":"c394f00e-7816-4bb2-b57b-b74c3e7e0d02","resolution":{"observed_at":"2026-08-07T11:11:54.781412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T11:04:05.852456Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03614","last_updated":"2025-06-04T06:46:06Z","snapshot_observed_at":"2026-08-11T17:17:06.206187Z","submitted_at":"2025-06-04T06:46:06Z","title":"VLMs Can Aggregate Scattered Training Patches","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:05.852456Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.03614"},"observation_digest":"sha256:69b882ff3349db5c9e7f199d4c7c59f5e774f4bfdbcd55e71daf1e1bb00223d7","observation_id":"b4727461-a149-4bd3-a45b-6ea9595f4598","resolution":{"observed_at":"2026-08-07T11:04:05.852456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T10:55:14.911563Z","title":"the third man to the left of the boy wearing a red shirt","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04034","last_updated":"2025-06-04T14:56:57Z","snapshot_observed_at":"2026-08-07T10:46:30.489099Z","submitted_at":"2025-06-04T14:56:57Z","title":"Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:14.911563Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.04034"},"observation_digest":"sha256:b53a47538c2c8989078445355775ab0d3b09b4aed564dfd2c6d03112fe5bad7a","observation_id":"b59dcb72-876f-4160-82fa-5a30bde78ca9","resolution":{"observed_at":"2026-08-07T10:55:14.911563Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T10:52:35.668975Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04141","last_updated":"2026-07-20T11:08:55Z","snapshot_observed_at":"2026-08-08T00:41:56.834898Z","submitted_at":"2025-06-04T16:33:41Z","title":"MMR-V: What's Left Unsaid? A Benchmark for Multimodal Deep Reasoning in Videos","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:52:35.668975Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.04141"},"observation_digest":"sha256:0eb9e5977325cdba190af924bcbf7ea611fb91dd50d0cd08c4e42f261c059769","observation_id":"a93883e8-83a9-4a11-ac5c-a00642dd05e3","resolution":{"observed_at":"2026-08-07T10:52:35.668975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T11:05:19.821194Z","title":"Do not in- clude any explanation. Only output your final answer in the ex- act format: Answer[<letter> or <your_answer_here>]","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04280","last_updated":"2025-06-04T04:21:32Z","snapshot_observed_at":"2026-08-09T12:57:20.961064Z","submitted_at":"2025-06-04T04:21:32Z","title":"Evaluating MLLMs with Multimodal Multi-image Reasoning Benchmark","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:05:19.821194Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.04280"},"observation_digest":"sha256:e1a0ca16319f157c1bbfe25881414a372189fef4db2272f52fa58c5b8f10dd97","observation_id":"242fbcc3-9161-4688-add2-97f2000fa578","resolution":{"observed_at":"2026-08-07T11:05:19.821194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T10:27:05.468595Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.468595Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:de32215fbe99609202f3dfa039005a835953c20fceb9622004a594d7b126c848","observation_id":"6be6bd9a-0430-44a7-9f86-3859b73daa87","resolution":{"observed_at":"2026-08-07T10:27:05.468595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T10:27:31.011248Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05336","last_updated":"2025-07-05T11:38:26Z","snapshot_observed_at":"2026-08-10T11:30:31.815084Z","submitted_at":"2025-06-05T17:59:29Z","title":"VideoMolmo: Spatio-Temporal Grounding Meets Pointing","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:31.011248Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.05336"},"observation_digest":"sha256:f8da0985bb009c1623f67a9d64f33221d388dc33026ea1d37ac2250dd90ba622","observation_id":"493fb17e-3258-499d-b49a-9c284528201d","resolution":{"observed_at":"2026-08-07T10:27:31.011248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T10:25:36.358934Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05349","last_updated":"2025-06-24T07:36:56Z","snapshot_observed_at":"2026-08-07T23:48:12.277994Z","submitted_at":"2025-06-05T17:59:58Z","title":"VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Videos","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:36.358934Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.05349"},"observation_digest":"sha256:d14499919e033d62ec40726bfeec56ddfb233ace945ea81ce251dd56b33862f6","observation_id":"15d0e53f-db6a-4af0-b7c5-10e219a037f9","resolution":{"observed_at":"2026-08-07T10:25:36.358934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2506.05425","last_updated":"2026-04-28T02:01:09Z","snapshot_observed_at":"2026-07-31T07:37:26.215945Z","submitted_at":"2025-06-05T05:51:35Z","title":"SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-19T11:36:36.687324Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.05425"},"observation_digest":"sha256:dc760bf3973ec8c1e394602eeace22ae8b8a0bcc5ba8a6874c2ca1ab40b39843","observation_id":"797883c6-4fa8-489b-90fa-97838cf7c6db","resolution":{"observed_at":"2026-05-19T11:37:15.720291Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T10:24:23.558902Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05450","last_updated":"2025-06-05T17:42:01Z","snapshot_observed_at":"2026-08-07T10:19:23.600490Z","submitted_at":"2025-06-05T17:42:01Z","title":"Degradation-Aware Image Enhancement via Vision-Language Classification","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:24:23.558902Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.05450"},"observation_digest":"sha256:771993ce0c0c1ecc43cca90328ca9c5563ee0aeb98ae2d7c2b6ad470377218a5","observation_id":"54b1c1b9-7d54-497d-8e8f-d898cebd1c34","resolution":{"observed_at":"2026-08-07T10:24:23.558902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2506.06211","last_updated":"2026-04-21T03:40:06Z","snapshot_observed_at":"2026-08-03T01:28:16.465454Z","submitted_at":"2025-06-06T16:17:09Z","title":"PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-19T10:43:02.601014Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.06211"},"observation_digest":"sha256:ccfbf368943478173c75d5492975127d7bd96747dd8ace0ba6b44fef38361513","observation_id":"71324b7e-4868-4669-9169-e59b8f1dc13f","resolution":{"observed_at":"2026-05-19T10:47:15.135941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T06:00:57.032403Z","title":"Pool” of movies (the “Pool","venue":null,"work_id":null,"year":1945},"citing_paper":{"arxiv_id":"2506.06275","last_updated":"2025-06-06T17:58:36Z","snapshot_observed_at":"2026-08-10T20:35:02.128344Z","submitted_at":"2025-06-06T17:58:36Z","title":"Movie Facts and Fibs (MF$^2$): A Benchmark for Long Movie Understanding","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T06:00:57.032403Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.06275"},"observation_digest":"sha256:633101b879f9a6c3b350ddab996ee512d661667ee420adfee5c714849e407bc5","observation_id":"ef4cd2f1-7031-42bb-99f4-518c23f15f8a","resolution":{"observed_at":"2026-08-07T06:00:57.032403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T05:26:47.320450Z","title":"Add key frames","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.320450Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:3416a5b76d05238770bb2021638ea9ef0d3f5b42c5e52f4232f3c80792429ef9","observation_id":"482ffa6f-a7bc-4d60-aff8-32ef23cb0176","resolution":{"observed_at":"2026-08-07T05:26:47.320450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T05:25:59.359646Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08012","last_updated":"2025-06-09T17:59:57Z","snapshot_observed_at":"2026-08-10T08:54:26.942546Z","submitted_at":"2025-06-09T17:59:57Z","title":"GUI-Reflection: Empowering Multimodal GUI Models with Self-Reflection Behavior","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:59.359646Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.08012"},"observation_digest":"sha256:389bb24bb3d6dd360ae64df520e13f598e93b51ff192b30af89fc0c698f3985d","observation_id":"49cb0657-4e38-4676-b54e-3acf8100c50d","resolution":{"observed_at":"2026-08-07T05:25:59.359646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2506.08052","last_updated":"2025-09-29T17:21:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-09T03:14:04Z","title":"ReCogDrive: A Reinforced Cognitive Framework for End-to-End Autonomous Driving","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T07:36:24.319361Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.08052"},"observation_digest":"sha256:6a5f3e5624c5f54ddd46b9cee0100d3d84470f8e3a14ad4757597b48dd1bd895","observation_id":"a00704df-5a5f-47aa-b894-baf2e328cd43","resolution":{"observed_at":"2026-05-15T07:36:24.492946Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T04:49:30.197911Z","title":"completion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09557","last_updated":"2025-06-11T09:41:46Z","snapshot_observed_at":"2026-08-09T00:11:49.117375Z","submitted_at":"2025-06-11T09:41:46Z","title":"AD^2-Bench: A Hierarchical CoT Benchmark for MLLM in Autonomous Driving under Adverse Conditions","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T04:49:30.197911Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.09557"},"observation_digest":"sha256:fe95da1846fc8abeb776eb04cdfe25a87b8ab9063957877834bf8abeaa29e0c4","observation_id":"44f0f79c-8ad7-4331-afd8-bbf13190d480","resolution":{"observed_at":"2026-08-07T04:49:30.197911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T04:40:37.973647Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09988","last_updated":"2025-06-11T17:58:25Z","snapshot_observed_at":"2026-08-11T12:35:17.560608Z","submitted_at":"2025-06-11T17:58:25Z","title":"EditInspector: A Benchmark for Evaluation of Text-Guided Image Edits","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:37.973647Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.09988"},"observation_digest":"sha256:ac21b28cc07d63c5f6646f849e380e070d5b87c55ed36f6f3c9cdb007471e393","observation_id":"34043248-d0ab-47ce-a149-911caeab7419","resolution":{"observed_at":"2026-08-07T04:40:37.973647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T04:17:59.889670Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10912","last_updated":"2026-06-02T18:21:07Z","snapshot_observed_at":"2026-08-07T04:11:40.527786Z","submitted_at":"2025-06-12T17:25:53Z","title":"Breaking Bad Molecules: Are MLLMs Ready for Structure-Level Molecular Detoxification?","version":4},"reference_index":155,"source":"pdf_text","source_observed_at":"2026-08-07T04:17:59.889670Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.10912"},"observation_digest":"sha256:197e223afaabac2ff27c4961151f3a7cfa2bf5cc90812c05e65e7d294f9756a9","observation_id":"6d1d6a56-dde6-489d-8637-f9f54565b541","resolution":{"observed_at":"2026-08-07T04:17:59.889670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T04:20:33.229755Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T17:11:06.528222Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:33.229755Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:7985638173ab5773d5a3f8f9ab61bba7f5d06db34346f5c71e72ac65c845757e","observation_id":"a8344eeb-4409-476e-8514-35f8472891fe","resolution":{"observed_at":"2026-08-07T04:20:33.229755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T04:07:34.864725Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-08T02:11:07.665188Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:34.864725Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:a92ead1c74c41f4c849bc1295d0a0c834380f977f11c0523512e4917e8c44bfa","observation_id":"3cbee560-f79c-4c3e-850a-a752a3295f19","resolution":{"observed_at":"2026-08-07T04:07:34.864725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T04:09:30.755791Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11672","last_updated":"2025-06-13T11:03:46Z","snapshot_observed_at":"2026-08-09T12:29:10.004034Z","submitted_at":"2025-06-13T11:03:46Z","title":"Dynamic Mixture of Curriculum LoRA Experts for Continual Multimodal Instruction Tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:30.755791Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.11672"},"observation_digest":"sha256:7813332ef087355ce868c592455a107d4d02f102b1d5f5bd9d57ac0e1f63da73","observation_id":"2193e504-0396-4d27-8390-f69c30c0412f","resolution":{"observed_at":"2026-08-07T04:09:30.755791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2506.11991","last_updated":"2026-05-01T04:30:18Z","snapshot_observed_at":"2026-08-02T17:00:42.491243Z","submitted_at":"2025-06-13T17:47:43Z","title":"VGR: Visual Grounded Reasoning","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-19T09:11:00.295700Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.11991"},"observation_digest":"sha256:5c0e995d650ba2f19584c58c343355b9e006b97417cbb0ec424ce4245ecb0601","observation_id":"ee80fc58-473b-4dee-ad2c-8da8c5ef9b52","resolution":{"observed_at":"2026-05-19T09:12:14.511231Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T00:55:30.570553Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12486","last_updated":"2025-06-14T12:54:07Z","snapshot_observed_at":"2026-08-10T12:32:55.773586Z","submitted_at":"2025-06-14T12:54:07Z","title":"DinoCompanion: An Attachment-Theory Informed Multimodal Robot for Emotionally Responsive Child-AI Interaction","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T00:55:30.570553Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.12486"},"observation_digest":"sha256:bb376186e13de886fa1af8be1da7bc1e1fecde690a4f1e413f5a9ce80adfa50d","observation_id":"6054d47b-14a4-44d6-a8ec-76c98143f6de","resolution":{"observed_at":"2026-08-07T00:55:30.570553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T00:48:34.911797Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:34.911797Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:192d0a6a878133cfc4160b3dba2d6b62d69c50cdc25e65e9ace9668add7c9365","observation_id":"fce9c156-8fc7-47df-8f60-e76731845313","resolution":{"observed_at":"2026-08-07T00:48:34.911797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T00:41:41.321355Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13038","last_updated":"2025-06-17T14:31:50Z","snapshot_observed_at":"2026-08-09T13:30:06.420632Z","submitted_at":"2025-06-16T02:03:41Z","title":"HKD4VLM: A Progressive Hybrid Knowledge Distillation Framework for Robust Multimodal Hallucination and Factuality Detection in VLMs","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:41.321355Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.13038"},"observation_digest":"sha256:5820398f56cb772cf98a6f26028a88b8dcbda62c372d4841fe0e025ab6aa3aeb","observation_id":"6cbfbc00-bc4e-4090-88cc-c476612276a2","resolution":{"observed_at":"2026-08-07T00:41:41.321355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T00:41:36.479613Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13284","last_updated":"2025-06-16T09:27:48Z","snapshot_observed_at":"2026-08-09T20:09:37.590476Z","submitted_at":"2025-06-16T09:27:48Z","title":"AceReason-Nemotron 1.1: Advancing Math and Code Reasoning through SFT and RL Synergy","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:36.479613Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.13284"},"observation_digest":"sha256:ee1d5ac365910336a1225bae6c22870727edc59e3f75a7288cdea110e8b9635b","observation_id":"39ae18ee-d0a8-474b-9222-8cddd87ad256","resolution":{"observed_at":"2026-08-07T00:41:36.479613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T00:23:56.322623Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source 14 multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14471","last_updated":"2025-06-17T12:35:23Z","snapshot_observed_at":"2026-08-08T10:16:30.506136Z","submitted_at":"2025-06-17T12:35:23Z","title":"Dense360: Dense Understanding from Omnidirectional Panoramas","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:56.322623Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.14471"},"observation_digest":"sha256:d568100b8150abafdca1407e0740d70bb6fc195a7303bccd03bc60b4884aad9c","observation_id":"12a90f74-4402-4da3-8371-388257d89423","resolution":{"observed_at":"2026-08-07T00:23:56.322623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T23:27:45.989262Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18048","last_updated":"2025-08-11T14:18:57Z","snapshot_observed_at":"2026-08-09T20:49:35.253219Z","submitted_at":"2025-06-22T14:32:15Z","title":"CLGRPO: Reasoning Ability Enhancement for Small VLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:45.989262Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.18048"},"observation_digest":"sha256:ca19327d64f8740440be22c6a3a48775240093077c68225cea878c7747a7e6f2","observation_id":"cba8af1b-81fd-4ced-9f49-ae5ffed51561","resolution":{"observed_at":"2026-08-06T23:27:45.989262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T22:36:39.894521Z","title":"Video-XL:2×","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.894521Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:b685c0c73321e587eacd75303e2c2780da528aee9220fcb27ebe4280df9bdb08","observation_id":"349009e5-9f3b-4f1c-9ff6-80ab18e6d2ae","resolution":{"observed_at":"2026-08-06T22:36:39.894521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T22:32:45.281287Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21317","last_updated":"2025-06-26T14:32:56Z","snapshot_observed_at":"2026-08-09T16:42:37.172114Z","submitted_at":"2025-06-26T14:32:56Z","title":"LLaVA-Pose: Enhancing Human Pose and Action Understanding via Keypoint-Integrated Instruction Tuning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:32:45.281287Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.21317"},"observation_digest":"sha256:a39ad4e6e23697064f3704c36ede03b106c9b8ffa76a86297d062b2e2b6e863f","observation_id":"9c23b3d1-a3c8-4ad6-8de2-7dfd2f22f349","resolution":{"observed_at":"2026-08-06T22:32:45.281287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T22:22:38.978885Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21863","last_updated":"2025-06-27T02:31:37Z","snapshot_observed_at":"2026-08-11T11:40:41.776672Z","submitted_at":"2025-06-27T02:31:37Z","title":"Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:22:38.978885Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.21863"},"observation_digest":"sha256:7fb554a0f1ab6d769212c531e302030c5c985dbe68966bab81ab265686a735cc","observation_id":"d9dcd1a2-1e1c-42ab-934b-5e83343b41f0","resolution":{"observed_at":"2026-08-06T22:22:38.978885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T22:18:37.640165Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21980","last_updated":"2025-07-22T15:39:40Z","snapshot_observed_at":"2026-08-06T22:11:53.372622Z","submitted_at":"2025-06-27T07:41:15Z","title":"R1-Track: Direct Application of MLLMs to Visual Object Tracking via Reinforcement Learning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:18:37.640165Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.21980"},"observation_digest":"sha256:f3807e25b896b4f3f8fc05ca6d480947297ef911fbd73f82c98c9e73a38f1595","observation_id":"853d58cd-65fb-4489-8823-a2d88a1469ae","resolution":{"observed_at":"2026-08-06T22:18:37.640165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T21:58:37.045728Z","title":"Step 1: Go to room 2 (on the right) and press the switch to drop a cube","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22992","last_updated":"2025-06-28T19:44:32Z","snapshot_observed_at":"2026-08-09T11:31:37.358797Z","submitted_at":"2025-06-28T19:44:32Z","title":"MARBLE: A Hard Benchmark for Multimodal Spatial Reasoning and Planning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:37.045728Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.22992"},"observation_digest":"sha256:a1a7da16390ecf0f88cbc06f9cdb8e989952112298604898616e8eadb7265733","observation_id":"8f2729da-216a-4dd5-b01d-af2c50343ca5","resolution":{"observed_at":"2026-08-06T21:58:37.045728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T22:01:21.610269Z","title":"InternVL3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23044","last_updated":"2025-07-01T09:33:23Z","snapshot_observed_at":"2026-08-06T21:49:22.757971Z","submitted_at":"2025-06-29T00:40:17Z","title":"Ovis-U1 Technical Report","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:21.610269Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.23044"},"observation_digest":"sha256:ec065b9ce1641980e6300b84fd10b1808a12e245260989ee60e5ad05f4b72e11","observation_id":"27412aec-328a-47fb-9fbc-581d57699664","resolution":{"observed_at":"2026-08-06T22:01:21.610269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T21:52:18.924233Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.924233Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:5404bd505dd6d23d9961927afe2ca9ccc5f69ee2605d80a901fb6dadd463ebb1","observation_id":"862d55c2-a190-4aa5-983e-591ccce7ca14","resolution":{"observed_at":"2026-08-06T21:52:18.924233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T21:44:51.870568Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","snapshot_observed_at":"2026-08-11T11:40:01.503195Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:51.870568Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.23491"},"observation_digest":"sha256:537b6deddaba7e06d8eb51b8ddbd65001c3933efc527690b46ef9505e227beac","observation_id":"30a0a296-4d0d-4cc7-8987-ab2dfd049432","resolution":{"observed_at":"2026-08-06T21:44:51.870568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T21:27:40.777286Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-11T02:17:33.995061Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.777286Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:7a671c130006ad3b99985f12c559b36704e7bd2e0b52efe17f567bc1a06a4756","observation_id":"8878ef5f-2876-42fe-ae8d-403b1ca08e06","resolution":{"observed_at":"2026-08-06T21:27:40.777286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T21:20:49.227807Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00490","last_updated":"2025-07-02T13:58:48Z","snapshot_observed_at":"2026-08-10T21:18:23.784067Z","submitted_at":"2025-07-01T07:06:32Z","title":"Just Noticeable Difference for Large Multimodal Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T21:20:49.227807Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2507.00490"},"observation_digest":"sha256:b6f93f69218ffc6df4487aeccf10a901f101484107f9bcf5f2f59cac55cc4798","observation_id":"69729ed6-3059-4b20-af91-b4a8f81f2fc5","resolution":{"observed_at":"2026-08-06T21:20:49.227807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2507.00748","last_updated":"2026-04-12T11:20:16Z","snapshot_observed_at":"2026-08-08T09:01:59.914584Z","submitted_at":"2025-07-01T13:48:57Z","title":"Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-19T06:50:02.607136Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2507.00748"},"observation_digest":"sha256:f25866b804170612ee1f7cd0e051f4a4ba38f22783fa358017a474fc01df9eb6","observation_id":"77218f32-162a-4987-874c-f41374e1bc4f","resolution":{"observed_at":"2026-05-19T06:52:08.133120Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:e8c9b89f43de00313b8abd7fdd917219929b57e312f0e4dd7ea6643d98e94bc9","observation_id":"22a1f710-e07d-4141-9ec1-bdb9ba20c755","resolution":{"observed_at":"2026-05-11T04:48:27.253853Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T20:53:10.771705Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01643","last_updated":"2025-07-02T12:17:23Z","snapshot_observed_at":"2026-08-10T17:36:05.348568Z","submitted_at":"2025-07-02T12:17:23Z","title":"SAILViT: Towards Robust and Generalizable Visual Backbones for MLLMs via Gradual Feature Refinement","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:10.771705Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2507.01643"},"observation_digest":"sha256:fb1e4a4fa057a3526b251ec3195ece0c85b955ebe54813f74c8361595457f74a","observation_id":"a7b7c1a9-136d-472a-b324-7cd735351659","resolution":{"observed_at":"2026-08-06T20:53:10.771705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T20:45:10.445998Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01949","last_updated":"2025-07-02T17:57:28Z","snapshot_observed_at":"2026-08-06T20:37:19.866170Z","submitted_at":"2025-07-02T17:57:28Z","title":"Kwai Keye-VL Technical Report","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:45:10.445998Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2507.01949"},"observation_digest":"sha256:4e694523c5386f833812321bb58efb42969605e59b5e15c34104b45f2a73fabd","observation_id":"0999d1ab-1d5a-4155-9634-3b779e585c12","resolution":{"observed_at":"2026-08-06T20:45:10.445998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T20:47:31.131012Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-08T02:43:34.071635Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:31.131012Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:826c835803128229b85152498f6857476219e335c1bf830fc63e13b34f764843","observation_id":"152ebfed-9f71-45d7-862a-04f50438a944","resolution":{"observed_at":"2026-08-06T20:47:31.131012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T20:35:58.842488Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02357","last_updated":"2025-07-03T06:43:05Z","snapshot_observed_at":"2026-08-11T16:17:55.588103Z","submitted_at":"2025-07-03T06:43:05Z","title":"Coling-UniA at SciVQA 2025: Few-Shot Example Retrieval and Confidence-Informed Ensembling for Multimodal Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T20:35:58.842488Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2507.02357"},"observation_digest":"sha256:a109bbcfdfbf8fdca8d848d5555631f6842406c990da90e5580451e11119bb12","observation_id":"db243b1a-9ebf-45a9-931b-edfadf59a114","resolution":{"observed_at":"2026-08-06T20:35:58.842488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T20:19:05.475777Z","title":"Respond ‘Yes’ or ‘No’","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03275","last_updated":"2025-07-04T03:27:04Z","snapshot_observed_at":"2026-08-09T13:57:09.821090Z","submitted_at":"2025-07-04T03:27:04Z","title":"ConceptMix++: Leveling the Playing Field in Text-to-Image Benchmarking via Iterative Prompt Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:19:05.475777Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2507.03275"},"observation_digest":"sha256:488efee24c362f29df3325e3c95bf2c5793677703494309f7f53adf43f7c7a4c","observation_id":"9419ae14-56e3-48af-a03b-5afd9c9958e8","resolution":{"observed_at":"2026-08-06T20:19:05.475777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T20:15:52.553874Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-09T01:40:47.049405Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.553874Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:96ae72b511efe93e3758aa827261af1289a4d592f39679356593f6525cdcf012","observation_id":"4e837ba1-77d1-4473-a9aa-2d5a7ee160d0","resolution":{"observed_at":"2026-08-06T20:15:52.553874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T20:12:20.956555Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Mod- els, (Technical Report)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.03541","last_updated":"2025-08-08T21:43:22Z","snapshot_observed_at":"2026-08-09T14:36:14.413699Z","submitted_at":"2025-07-04T12:46:45Z","title":"Foundation versus Domain-specific Models: Performance Comparison, Fusion, and Explainability in Face Recognition","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T20:12:20.956555Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2507.03541"},"observation_digest":"sha256:c6cfbde68882b49557de6399079b68b4641e4fb0e3a6519878dba9fbeea4a873","observation_id":"fd02ebad-55c7-4314-b2ce-37e4ab195079","resolution":{"observed_at":"2026-08-06T20:12:20.956555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T19:46:12.507168Z","title":"et al., 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04664","last_updated":"2025-07-07T05:10:15Z","snapshot_observed_at":"2026-08-07T21:59:53.729374Z","submitted_at":"2025-07-07T05:10:15Z","title":"VectorLLM: Human-like Extraction of Structured Building Contours vis Multimodal LLMs","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:12.507168Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2507.04664"},"observation_digest":"sha256:aed3db719e8e1a0599834fef38a7480fd208ff5449b4fd8b0c21bd27b3c1b1dd","observation_id":"9a05b92b-45ab-4985-8480-3b916fd85525","resolution":{"observed_at":"2026-08-06T19:46:12.507168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T19:20:57.763553Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.05934","last_updated":"2025-07-08T12:34:10Z","snapshot_observed_at":"2026-08-10T13:09:35.657553Z","submitted_at":"2025-07-08T12:34:10Z","title":"BlueLM-2.5-3B Technical Report","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T19:20:57.763553Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2507.05934"},"observation_digest":"sha256:f6dbb1b413b3bf13eff1a9c05d9cc2cb5f9667c6d66aa268f4daed56d4c48c14","observation_id":"4eaaa038-ee8b-4475-9fcb-d7a3e6d9708e","resolution":{"observed_at":"2026-08-06T19:20:57.763553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T19:14:07.140185Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06167","last_updated":"2025-07-10T15:41:04Z","snapshot_observed_at":"2026-08-07T10:37:03.707334Z","submitted_at":"2025-07-08T16:47:16Z","title":"Skywork-R1V3 Technical Report","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T19:14:07.140185Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2507.06167"},"observation_digest":"sha256:619659665121b80081d1e6da22a5ac29f57c5b01b3c779582afd24de10b2f97a","observation_id":"12c77fae-44e4-4e2f-8811-b35043c4d6db","resolution":{"observed_at":"2026-08-06T19:14:07.140185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.10479/citation-record","integrity":"/paper/2504.10479/integrity","json":"/paper/2504.10479/citation-record.json","paper":"/paper/2504.10479"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:de7f6622585413f9e7e8f06114690fbe0db53d755fe248f1ae70be76b6cfc34e","observation_id":"56017071-d3c3-44f2-9f57-4525753d64e0","resolution":{"observed_at":"2026-05-10T13:41:08.208175Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CG-bench: Clue-grounded question answering benchmark for long video understanding","venue":null,"work_id":"0a81f144-5340-4ece-9994-a8e05076d77c","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:1e0435ae184dc26adb38c2fbcdfc40298978d6177b98911919573f3a6c6cac8f","observation_id":"2e17a19a-faef-4fb3-89d2-93dccb5fc7e7","resolution":{"observed_at":"2026-05-10T13:41:08.383503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":"ab1c292d-49cb-4cc9-9564-03999cdadd45","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:9d0a5b17d64317f9d959fdf0e1548bdcf3c0d1b69ceef084ab3b4c0daf0ccd43","observation_id":"4cd3784e-e2b9-4c1d-973c-a9cb153bf5dc","resolution":{"observed_at":"2026-05-10T13:41:08.385656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":"2108.07732","doi":"10.1007/s11390-025-5518-5","metadata_source":"pith","pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Program Synthesis with Large Language Models","venue":"cs.PL","work_id":"fd241a05-03b9-4de2-9588-9d77ce176125","year":2021},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:aa575bf481463efa4f42f23e72357ef4e2aaf3febfeba3f95dda0acd34a0349a","observation_id":"63863f0e-fa66-4640-bfa0-d32424c8477e","resolution":{"observed_at":"2026-05-10T13:41:08.210622Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:b665b488fe4ea9b4262c768ae563e30284b8fbc0806ab5ce4631cd8c678e1a3e","observation_id":"dacd29b5-663f-401d-ad1b-1e58422fd67b","resolution":{"observed_at":"2026-05-10T13:41:08.213086Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:d9fe66f97f17237aa67deb2e877434fed57f1e7e0d0c723f4e9aa0b25b1718df","observation_id":"0fa9c2e0-f66a-476b-84f0-a2fde5a65dbe","resolution":{"observed_at":"2026-05-10T13:41:08.215773Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Smollm-corpus","venue":null,"work_id":"b8ae8f1b-5ad2-4f27-97b8-bdca0564bc79","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:9eff4d5329d7d68e8525ea2f436dbd83e2cd15836ea4d2014da07e5ede9cfab6","observation_id":"56e9debf-ff99-48e2-8b42-93b9f328610b","resolution":{"observed_at":"2026-05-10T13:41:08.393133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scene text visual question answering","venue":null,"work_id":"2161de18-d4ca-466c-a927-aac17c0ff245","year":2019},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:b61f740d3d6853e70809cf143393c95e313af95b285fd6bda9df2b58a0a40666","observation_id":"16bddcd9-47ee-4ec1-8499-4d73fc809b7e","resolution":{"observed_at":"2026-05-10T13:41:08.398362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An augmented benchmark dataset for geometric question answering through dual parallel text encoding","venue":null,"work_id":"fbd68e28-4308-4c1c-b32b-c65f177d1c9a","year":null},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:90831ed99d3fa94dc8af0bf107222a204dbc54446b836db66b66c4add4fb89b1","observation_id":"3e75801c-f429-4383-8e31-44b2df9bf678","resolution":{"observed_at":"2026-05-10T13:41:08.400351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.08545","last_updated":"2022-11-15T22:31:38Z","snapshot_observed_at":"2026-08-09T22:32:24.524992Z","submitted_at":"2022-11-15T22:31:38Z","title":"MapQA: A Dataset for Question Answering on Choropleth Maps","version":1},"cited_work":{"arxiv_id":"2211.08545","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.08545","snapshot_observed_at":"2026-07-02T21:17:24.219845Z","title":"MapQA: A dataset for question answering on choropleth maps","venue":null,"work_id":"6e611921-6f4e-4ace-8a5f-5589c4c99bb9","year":2022},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2211.08545","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:a126c2eda8a905bd77606e0f2dfc6bb7a84f389d6afc1f884b0522bf717b9250","observation_id":"13f3b8a6-0ebf-4a73-8942-754f92418f5f","resolution":{"observed_at":"2026-05-10T13:41:08.218987Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":"2306.15195","doi":"10.48550/arxiv.2306.15195","metadata_source":"pith","pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","venue":"cs.CV","work_id":"44525076-312a-4259-b79c-134cd7eeb297","year":2023},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:9add7eed9dd82b204c16102bf19734b9216f4d19d736addbbf675a54bb44817f","observation_id":"429dc09c-1502-4571-9bb8-5aeaac25600d","resolution":{"observed_at":"2026-05-12T15:52:36.167809Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":"2403.20330","doi":"10.48550/arxiv.2403.20330","metadata_source":"pith","pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","venue":"cs.CV","work_id":"0d0b977c-a42e-49b1-869e-b7360dca5282","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:8c0711aceac12ce655a62ef92948040b4348e374cab5251440b9e01bb60d6b56","observation_id":"af2f885b-c983-414d-aaa1-0758eb7f8dc2","resolution":{"observed_at":"2026-05-12T19:41:44.612219Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.921853+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.921853+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:32c42cbe84e512912df9e2fb9ff0d1088328f2cf211d81e659b4eddc831624d4","observation_id":"8ad0c483-aaf4-418f-ab69-77dcef1b97ab","resolution":{"observed_at":"2026-05-10T13:41:08.227090Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09149","last_updated":"2024-01-22T06:40:44Z","snapshot_observed_at":"2026-08-06T16:04:50.873689Z","submitted_at":"2024-01-17T11:47:59Z","title":"InternEvo: Efficient Long-sequence Large Language Model Training via Hybrid Parallelism and Redundant Sharding","version":3},"cited_work":{"arxiv_id":"2401.09149","doi":"10.48550/arxiv.2401.09149","metadata_source":"arxiv_reference","pith_arxiv_id":"2401.09149","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2401.09149 , year=","venue":"arXiv (Cornell University)","work_id":"df9eb565-60d6-4240-9926-b66f4bada72b","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2401.09149","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:24791fec4261262132d11380e26d0c987fa438b55a563f498abeadd491cc2c37","observation_id":"c777bb48-c43a-44be-9197-3c0d73e0aa55","resolution":{"observed_at":"2026-05-10T13:41:08.230480Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16473","last_updated":"2024-05-26T07:56:30Z","snapshot_observed_at":"2026-08-11T03:35:32.869778Z","submitted_at":"2024-05-26T07:56:30Z","title":"M$^3$CoT: A Novel Benchmark for Multi-Domain Multi-step Multi-modal Chain-of-Thought","version":1},"cited_work":{"arxiv_id":"2405.16473","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.16473","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M3cot: A novel bench- mark for multi-domain multi-step multi-modal chain-of-thought.arXiv preprint arXiv:2405.16473","venue":null,"work_id":"4d99c33a-262f-4545-baae-925205f5b2bc","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2405.16473","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:d40558a7dfe5e709752a0db18a28fa2af10686c5ed90b37ed1e35e16f927d5dd","observation_id":"3b253375-e068-4098-b7f3-71a665c88a01","resolution":{"observed_at":"2026-05-10T13:41:08.233339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Theoremqa: A theorem-driven question answering dataset","venue":null,"work_id":"c484028e-9a8d-4cef-aa3f-44f554f0580c","year":2023},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:498c8b2aeb545c233e886e2ce384c3245c5a1861bba1423034a694e0cacc797d","observation_id":"56c4f3d4-7eeb-46d2-9c5e-0224e90f59ad","resolution":{"observed_at":"2026-05-10T13:41:08.412722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:31291794b4faa0178550de3a09a764591e7514ae2dc0e5b021f4e504f5670d09","observation_id":"dca35e67-146b-42ea-926a-304bbc25abee","resolution":{"observed_at":"2026-05-10T13:41:08.239742Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":"2404.16821","doi":"10.48550/arxiv.2404.16821","metadata_source":"pith","pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","venue":"cs.CV","work_id":"3714835e-c5a6-4d7e-950c-be44670ed9e6","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:63683a5b042e2ce07b3b90d04c78c0dfbb74476fff6e2cd73d8cab23caf3ad7e","observation_id":"e18683e8-78b7-4cc3-bf15-7280ace80e77","resolution":{"observed_at":"2026-05-12T20:58:59.653229Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"484d8fa0-b6e2-422b-8e06-c604da160648","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:2e134ee2b0b3da6b8acb7af7e723c70b9ed82a93b88d6004500896110e41dd34","observation_id":"64555317-3d21-4729-84f6-87b8917bc516","resolution":{"observed_at":"2026-05-10T13:41:08.418301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10935","last_updated":"2024-02-23T04:36:51Z","snapshot_observed_at":"2026-08-11T07:36:02.871665Z","submitted_at":"2024-01-17T08:10:35Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","version":2},"cited_work":{"arxiv_id":"2401.10935","doi":"10.48550/arxiv.2401.10935","metadata_source":"pith","pith_arxiv_id":"2401.10935","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","venue":"cs.HC","work_id":"8fe50425-9d6d-4080-bd43-51b3d0d0e5f6","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2401.10935","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:5e053c58043dd6ca70c54d4b523271e4df701e3455ed189a00dffe2d59cb7d80","observation_id":"961d9827-e406-43d2-8d20-f8de8d333c19","resolution":{"observed_at":"2026-05-17T10:09:46.778093Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":"2406.07476","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-07-04T16:49:57.279303Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","venue":"cs.CV","work_id":"ccfc3f89-c510-45f1-8a35-ed1a56c0ae5c","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:c91a1e05b774509d7bd7b13dd30b370bc552de9786c93d9e49c5a5c86627b191","observation_id":"227cab50-7277-48a6-be3a-21050c0ba8bc","resolution":{"observed_at":"2026-05-11T02:44:53.738794Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simple and effective multi-paragraph reading comprehension","venue":null,"work_id":"d6db9d05-2c6f-4e1f-a693-16b0a607ed2b","year":2018},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:f2754212dbe8a51f2b32c636d7553cef9776587529b34ce4a1d1ab7aa7da45c8","observation_id":"d93645c5-e167-4955-b7ae-aeebb07c2b9d","resolution":{"observed_at":"2026-05-10T13:41:08.423799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:7d70060eb5b8c0a5bafd86dae791c27c420588a96992748588e76ee56ca92a41","observation_id":"0269d5fd-ab27-485f-92ec-8843919b3837","resolution":{"observed_at":"2026-05-10T13:41:08.255963Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Opencompass: A universal evaluation platform for foundation models","venue":null,"work_id":"f6e9a1c8-4bec-4321-b2a6-e333249b5441","year":2023},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:33e1781396d6c3e28ecfe7d8a8242114753c498c45cf684f23872622e8e11d07","observation_id":"63360a63-bc28-49cd-a554-19ad2935a695","resolution":{"observed_at":"2026-05-10T13:41:08.427459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grok-1.5 vision preview: Connecting the digital and physical worlds with our first multimodal model","venue":null,"work_id":"83a54c58-f043-436b-90d1-e437266d40f8","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:600f53b53a2482c3bc36187b6a4c610cfe3aaf1b8a7d880c1702d8431665c5eb","observation_id":"aed4d604-7f67-4fb5-acd5-19d54a362ef9","resolution":{"observed_at":"2026-05-10T13:41:08.429410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-07-06T19:17:02.745056Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2409.11402","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-07-02T02:56:29.429018Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","venue":null,"work_id":"05897a70-23cd-425f-b903-02c1293c04a0","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:2d372d6bec657bc8e6350935e08ce382e011f8ba3ccab7077e512fa7da53bfa5","observation_id":"f6e4e7ae-6dc9-4717-8785-6343b01fb55a","resolution":{"observed_at":"2026-05-10T13:41:08.258635Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini 2.0 is now available to everyone","venue":null,"work_id":"7abd3302-899a-42e3-9e1b-e6fbde973dcb","year":2025},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:849bf4b47fd573341922cf7038d5f18e2f9edbda2755f49b02c33b5828a43801","observation_id":"e404920f-6e33-477a-ad91-4c1664591cb8","resolution":{"observed_at":"2026-05-10T13:41:08.436338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing gemini 2.0: our new ai model for the agentic era","venue":null,"work_id":"f061286a-edd1-4ab9-9e93-88a269a53789","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:42a3e4bd32934557bea58da1a05e049c3becae7b61f2d9dcd4adef8fb2372f72","observation_id":"2ee03a1c-19f5-41c9-9997-a3b38fd9f75b","resolution":{"observed_at":"2026-05-10T13:41:08.438018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:e6e48062586dc2491ea65f9226a219a26d6d849d299670817d199d18ae0e5457","observation_id":"e00a2882-d65a-4442-a090-1dfebde268d7","resolution":{"observed_at":"2026-05-15T01:55:12.888993Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06512","last_updated":"2024-04-09T17:59:32Z","snapshot_observed_at":"2026-08-06T19:00:20.787763Z","submitted_at":"2024-04-09T17:59:32Z","title":"InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD","version":1},"cited_work":{"arxiv_id":"2404.06512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.06512","snapshot_observed_at":"2026-07-04T08:19:44.167431Z","title":"Internlm-xcomposer2-4khd: A pioneer- ing large vision-language model handling resolutions from 336 pixels to 4k hd","venue":null,"work_id":"799b1f12-2edc-4b09-a83b-dbd87e1404e7","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2404.06512","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:42effbd8beb4b5b2b1a6563b160e8557ff97e19b9f6dbbfacff3a0eeab97d143","observation_id":"35a7f493-0b75-4099-bfd8-01d8a6304fee","resolution":{"observed_at":"2026-05-10T13:41:08.267570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":"1a03ade5-69df-41a9-9eb7-89f93b8d4b15","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:f54bceddf3bb09a068a1109b236b407d7381524740ae9377462a7902a6678ae3","observation_id":"47cad76e-e666-46ea-ba99-6a4137ee179a","resolution":{"observed_at":"2026-05-10T13:41:08.443073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:e2a29d5bb56c9ac5fdb996f80ab66e2c8aa86fc334f61bab8d3ba95e47e5d65e","observation_id":"7b947b91-e3f4-487e-9520-5283c96336b4","resolution":{"observed_at":"2026-05-10T13:41:08.270190Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14515","last_updated":"2024-10-30T13:38:10Z","snapshot_observed_at":"2026-08-10T10:57:30.502675Z","submitted_at":"2024-06-20T17:26:01Z","title":"MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding","version":3},"cited_work":{"arxiv_id":"2406.14515","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14515","snapshot_observed_at":"2026-06-28T23:12:46.636950Z","title":"Mmbench-video: A long-form multi-shot benchmark for holistic video under- standing","venue":null,"work_id":"0108342f-f183-4a3e-930e-337bd83a6601","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2406.14515","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:a29d917a1584ad42bb707b5899398844513bbd7729ecdb4bc1127d17cbca3801","observation_id":"a6b6f22f-c849-40be-aee7-4c23dfdc372a","resolution":{"observed_at":"2026-05-10T13:41:08.272679Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning generative visual models from few training examples: An incremental bayesian approach tested on 101 object categories","venue":null,"work_id":"c04d7b4e-1a20-4279-b24e-b1c5203687dd","year":2004},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:75dcab23e2a64125b86a16aa1c8e9b3ff62e0add72143327c24488352718c345","observation_id":"1f651706-54cc-4dd6-907f-48668b377f05","resolution":{"observed_at":"2026-05-10T13:41:08.448276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":"2306.13394","doi":"10.48550/arxiv.2306.13394","metadata_source":"pith","pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-10T13:27:05.561984Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":"cs.CV","work_id":"806d2e73-71b3-4d56-87e0-39d571cc15d6","year":2023},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:266407242b7bab722332b56969da3afc13ded4cf2604cccd9718c3630326112b","observation_id":"e1a23374-18ff-42bc-945b-9af51eaeeb19","resolution":{"observed_at":"2026-05-10T20:25:34.870358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.033703+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.033703+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":"2405.21075","doi":"10.1609/icwsm.v17i1.22209","metadata_source":"pith","pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","venue":"cs.CV","work_id":"77fd5ac9-ae98-4846-9d83-e9c73c8f2a52","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:eb03778127a6fa2dcd9d476b1a34151f2d836d4d3cf1cdecdac2b45a1d3154fe","observation_id":"39e2b465-27e0-4d0a-8d4a-4112ab8b9bf3","resolution":{"observed_at":"2026-05-11T01:58:42.298802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:2e4833590dc9497ed41df16d61ffec1e167cc42d431119ae8d21f7e2ad71951a","observation_id":"2a242639-a304-471e-8c5f-5b5ad78f44e1","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11370","last_updated":"2025-08-20T15:45:11Z","snapshot_observed_at":"2026-08-02T03:18:39.824103Z","submitted_at":"2023-12-18T17:36:20Z","title":"G-LLaVA: Solving Geometric Problem with Multi-Modal Large Language Model","version":2},"cited_work":{"arxiv_id":"2312.11370","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.11370","snapshot_observed_at":"2026-07-10T01:46:40.938849Z","title":"G-LLaVA: Solving Geometric Problem with Multi- Modal Large Language Model","venue":"cs.CL","work_id":"3a63b857-2284-4d2e-93fe-e112cfbc77ea","year":2023},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2312.11370","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:abc5d9c373b4086176cdcfa7a33c34e004d982016ac2fd62b2055d2f0344909b","observation_id":"99c40049-2da8-48ca-908d-407fabca8222","resolution":{"observed_at":"2026-05-10T13:41:08.303127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16261","last_updated":"2024-11-07T15:35:52Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:58:20Z","title":"Mini-InternVL: A Flexible-Transfer Pocket Multimodal Model with 5% Parameters and 90% Performance","version":3},"cited_work":{"arxiv_id":"2410.16261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.16261","snapshot_observed_at":"2026-07-04T10:39:44.698268Z","title":"Mini-internvl: A flexible-transfer pocket multimodal model with 5% parameters and 90% performance","venue":null,"work_id":"7a269605-bab1-4712-a316-89c2d540ebcc","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2410.16261","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:922020cd8a5aaa13425ff25dae7f8af3919f9281210c44e33bdce0d3ae78b9a8","observation_id":"74a09442-949e-43fa-b0e9-8dcd2b66185e","resolution":{"observed_at":"2026-05-10T13:41:08.305987Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09616","last_updated":"2024-12-13T04:58:33Z","snapshot_observed_at":"2026-08-11T16:49:47.892018Z","submitted_at":"2024-12-12T18:59:46Z","title":"V2PE: Improving Multimodal Long-Context Capability of Vision-Language Models with Variable Visual Position Encoding","version":2},"cited_work":{"arxiv_id":"2412.09616","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09616","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"V2PE: improving multimodal long-context capability of vision-language models with variable visual position encoding","venue":null,"work_id":"a8db0ee9-9165-4d46-baa9-c37868fbfbf9","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2412.09616","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:c0ebfaa8b42cf08e3d525c11ea56d0879459a51f1690c8797414c7ff3d20f12f","observation_id":"7567a43a-81e0-4548-bf55-f8e0092efe2b","resolution":{"observed_at":"2026-05-10T13:41:08.309183Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":"e69b6878-6e72-4a31-97b6-537f1340c9e6","year":2017},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:8cd6b04a3c0dc0f174fe23b726cef5ee50b7adbb1e4edcf29e1c404a431ca695","observation_id":"6e854932-c0a3-48ab-bd1f-687d4ebbd5ea","resolution":{"observed_at":"2026-05-10T13:41:08.461898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18558","last_updated":"2025-01-06T12:48:47Z","snapshot_observed_at":"2026-07-06T19:38:57.409491Z","submitted_at":"2024-10-24T09:03:48Z","title":"Infinity-MM: Scaling Multimodal Performance with Large-Scale and High-Quality Instruction Data","version":2},"cited_work":{"arxiv_id":"2410.18558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.18558","snapshot_observed_at":"2026-07-04T09:59:44.997303Z","title":"Infinity-mm: Scaling multimodal performance with large-scale and high-quality instruction data","venue":null,"work_id":"f63b5594-3d56-4965-9657-b11d801dcbe7","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2410.18558","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:e464506fe299d07d2664dc520efe0fdefa11be1515eaa721401662d4d70addde","observation_id":"62830ee8-01c9-4fcd-a88b-38ec23fbcc33","resolution":{"observed_at":"2026-05-10T13:41:08.311987Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14566","last_updated":"2024-03-25T06:05:24Z","snapshot_observed_at":"2026-08-02T21:20:28.501823Z","submitted_at":"2023-10-23T04:49:09Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":"2310.14566","doi":"10.48550/arxiv.2310.14566","metadata_source":"pith","pith_arxiv_id":"2310.14566","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","venue":"cs.CV","work_id":"9e143dc0-9074-4760-b9db-ef0ac15dc3cc","year":2023},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2310.14566","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:c008b567a77c071fc968f44e502650405feec0e247ffd381bd9296d82a81a3cb","observation_id":"6f218f3e-0620-4daf-b312-46e0ebea4e4b","resolution":{"observed_at":"2026-05-17T01:22:04.360724Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":"5deb034b-c839-4489-af1d-cf7663dbe863","year":null},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:63f3e1034cb797de5b0743036ad276038c58c6dafd6ce7ed25fdac4971a55406","observation_id":"279fd556-6349-42b0-959c-6fb4965345ff","resolution":{"observed_at":"2026-05-10T13:41:08.467485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":"7ac3d06b-a064-4f22-b784-553c3518e773","year":2021},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:91e595eda9c716d83108a0542877f016c0cd4389bd0979271836e8f39bb2e333","observation_id":"34e69bd0-2ebd-4d68-9c92-ce33ac0843c3","resolution":{"observed_at":"2026-05-10T13:41:08.469249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"C-eval: A multi-level multi-discipline chinese evaluation suite for foundation models","venue":null,"work_id":"f5c455a3-8d79-4d5c-b9a6-d28c7032e61b","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:9b417684326590f8c15b933e55c018e8b6cef807853bc5be51b756807345655a","observation_id":"6c1e602a-50df-4a1e-954e-f2cfd5bdf537","resolution":{"observed_at":"2026-05-10T13:41:08.470959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Icdar2019 competition on scanned receipt ocr and information extraction","venue":null,"work_id":"82e57a9a-3de1-48f4-810f-b247559ef4ef","year":2019},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:40282f9587ec9740e543fe0ba0e48970a44886833e5968eca9322789b4c4f804","observation_id":"ad463b37-61ec-4d5f-82f7-14b4a3592bb1","resolution":{"observed_at":"2026-05-10T13:41:08.472622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"6ee3493c-fa37-421c-9c57-31f56a84e2d0","year":2019},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:d5b02aa525c25e1ab18a5a1c10ab4bd23d98bcf5761dada6d37616bcbf4e789d","observation_id":"97185d93-673d-4468-ad97-ab643a72e62d","resolution":{"observed_at":"2026-05-10T13:41:08.474271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2405.01483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-07-04T20:40:07.542575Z","title":"Ku, Qian Liu, and Wenhu Chen","venue":null,"work_id":"ca7dd196-dc3e-4e3c-af1e-c0b02fc0efed","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:ae0be1e7552fa8c8716f3ab3172ad291e36659b7230e44ce1c4795a7e8908f8f","observation_id":"c5e544a3-4cd7-4dc9-a46a-cdf8e342dd3a","resolution":{"observed_at":"2026-05-10T13:41:08.322697Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.03551","last_updated":"2017-05-13T21:12:37Z","snapshot_observed_at":"2026-08-02T11:13:42.401488Z","submitted_at":"2017-05-09T21:35:07Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","version":2},"cited_work":{"arxiv_id":"1705.03551","doi":"10.48550/arxiv.1705.03551","metadata_source":"pith","pith_arxiv_id":"1705.03551","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","venue":"cs.CL","work_id":"f20e62ba-6265-4b97-aa8c-ddefaf2f5762","year":2017},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/1705.03551","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:8cd4cba4493b71e26e529a3569ea48a26ab2d61a54198d90bdf1e62b3f9e7d27","observation_id":"ba68e2b8-5aaa-4396-8d27-03fa089ed5d5","resolution":{"observed_at":"2026-05-11T15:00:28.883814Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04656","last_updated":"2025-06-09T07:10:33Z","snapshot_observed_at":"2026-08-11T08:35:38.807064Z","submitted_at":"2024-04-06T15:20:59Z","title":"Binary Classifier Optimization for Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":"2404.04656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.04656","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Binary classifier optimization for large language model alignment","venue":null,"work_id":"43a7e7cc-3252-4b0b-885f-a63878a941ad","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2404.04656","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:5b94d6a13479d0f85873c92dc872241abd3ac61393dd667eb3b6285f2190492c","observation_id":"197dbeae-0714-4cb4-b632-28d1edc8729f","resolution":{"observed_at":"2026-05-10T13:41:08.328045Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dvqa: Understanding data visualizations via question answering","venue":null,"work_id":"783428a3-921d-47ea-a6b4-fdf88462bfeb","year":2018},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:44591978e494068b1ffda796e2f2f4121b7426dc6160acfb2a15b1076060d1d9","observation_id":"ca1c5b0f-7d92-4288-b8ad-0a6c1657a248","resolution":{"observed_at":"2026-05-10T13:41:08.480948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12241","last_updated":"2023-12-19T15:25:39Z","snapshot_observed_at":"2026-08-07T13:16:45.623593Z","submitted_at":"2023-12-19T15:25:39Z","title":"GeomVerse: A Systematic Evaluation of Large Models for Geometric Reasoning","version":1},"cited_work":{"arxiv_id":"2312.12241","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.12241","snapshot_observed_at":"2026-07-03T20:48:56.071888Z","title":"Kazemi, H","venue":null,"work_id":"a6a0af2b-e0d6-4234-9409-9f4eecda7ca5","year":2023},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2312.12241","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:835ec7cbca77faa1eb4e06e11e863f2803f074c295499d74470c212acb5df057","observation_id":"9c4e5890-e323-4baa-91b5-86b83b4d3d67","resolution":{"observed_at":"2026-05-10T13:41:08.330629Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Referitgame: Referring to objects in photographs of natural scenes","venue":null,"work_id":"01ab4320-6411-477d-9484-c2aabc54d2c3","year":2014},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:d27e897a629ea2cc7beda39697e61c15aa88cc7c80acd9357f3271ff327fea54","observation_id":"af44c27e-5484-4633-b6b8-e00174edd9bc","resolution":{"observed_at":"2026-05-10T13:41:08.488031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"c6768848-a110-45a1-955c-ed40e6cd8a49","year":2016},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:190866861b36311fc7f5a9b5c511848ddbc7779266e97b2292f76179763a72ad","observation_id":"a0f678d5-20ab-4f89-95ec-4107f9bdf393","resolution":{"observed_at":"2026-05-10T13:41:08.489624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Natural questions: a benchmark for question answering research","venue":null,"work_id":"18c7dcbc-c692-484f-b94d-3865486b5974","year":2019},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:fa1f163424da4c41489dd465079e2e0f76e3b55eac2e826c214da814ff7e724e","observation_id":"cbe6585c-29e2-4f76-98d2-f600653cae00","resolution":{"observed_at":"2026-05-10T13:41:08.498152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04683","last_updated":"2017-12-05T19:36:03Z","snapshot_observed_at":"2026-08-07T10:40:47.462532Z","submitted_at":"2017-04-15T19:31:41Z","title":"RACE: Large-scale ReAding Comprehension Dataset From Examinations","version":5},"cited_work":{"arxiv_id":"1704.04683","doi":null,"metadata_source":"pith","pith_arxiv_id":"1704.04683","snapshot_observed_at":"2026-07-09T12:46:14.670125Z","title":"RACE: Large-scale ReAding Comprehension Dataset From Examinations","venue":"cs.CL","work_id":"e2a3ad65-9a8a-4152-9f18-57d60652a87d","year":2017},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/1704.04683","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:cbc1c5d6e362c7af6da2367b5840779e740a1dd50cb798379f68c4605125fe89","observation_id":"efac3ba4-3f1d-4ee6-8e09-c65a3426cbcf","resolution":{"observed_at":"2026-05-10T13:41:08.333091Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:b07a05871e311d7303b9c25c5911b3f7e8b5b0fe50442091810b33661160b328","observation_id":"68f46997-cb03-46d6-9992-693bf6a94c74","resolution":{"observed_at":"2026-05-10T13:41:08.335417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-06T04:28:38.934829Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":"2404.16790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-07-05T04:30:40.718071Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":"892bf722-73fc-4b2e-858d-e1dddc728b4c","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:8f3752f5424b05c8daa1ecfda2e73d5e582d1d09300ea54e693e3bbb44421df1","observation_id":"6ffa1d7f-aaee-47f1-9efa-8d2f643abf52","resolution":{"observed_at":"2026-05-10T13:41:08.337965Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05474","last_updated":"2024-10-07T20:12:08Z","snapshot_observed_at":"2026-08-05T09:24:44.719989Z","submitted_at":"2024-10-07T20:12:08Z","title":"R-Bench: Are your Large Multimodal Model Robust to Real-world Corruptions?","version":1},"cited_work":{"arxiv_id":"2410.05474","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05474","snapshot_observed_at":"2026-07-02T16:27:09.551181Z","title":"R-bench: Are your large multimodal model robust to real-world corruptions?","venue":null,"work_id":"421c949f-8096-4b51-ac3e-04801c456afc","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2410.05474","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:9f077904011c88da0409c0068da62cdb9301ff5b2fc8b11be8cf59ddcb307a2f","observation_id":"cde53698-b607-4154-bbb3-3f3c3d1803a7","resolution":{"observed_at":"2026-05-10T13:41:08.340531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09212","last_updated":"2024-01-17T19:09:57Z","snapshot_observed_at":"2026-08-04T18:52:19.083847Z","submitted_at":"2023-06-15T15:49:51Z","title":"CMMLU: Measuring massive multitask language understanding in Chinese","version":2},"cited_work":{"arxiv_id":"2306.09212","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.09212","snapshot_observed_at":"2026-06-29T19:43:55.030793Z","title":"CMMLU: Measuring massive multitask language understanding in Chinese","venue":"cs.CL","work_id":"30c9ec62-1af0-4f30-94b4-d1ef163eff71","year":2023},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2306.09212","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:001d1b84a6cd74d6f265e7320abc57e7cd2db6aa8bd8982a880261f359391af9","observation_id":"bc7aac1e-221a-4981-9a6c-2daedea49371","resolution":{"observed_at":"2026-05-16T21:01:11.049549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":"2305.06355","doi":"10.48550/arxiv.2305.06355","metadata_source":"pith","pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoChat: Chat-Centric Video Understanding","venue":"cs.CV","work_id":"07461eec-156c-4054-a28e-b84bc53bf6e1","year":2023},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:2e81537aab0663f0059feeb513369b8ec6badaa46e98620a420c6e4d2db2c894","observation_id":"96dde0f3-38d0-406b-b44d-5595cf56c437","resolution":{"observed_at":"2026-05-13T23:30:00.879549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":"4a7c9ee4-fa19-472a-a9a7-228c5bf333ce","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:8629ebfdd23c81b734570d3a52929681d7f6fbc0648c9300959b8f8a3e9d5b2d","observation_id":"ea763f14-65cd-43f4-8f5d-e3f4e8522369","resolution":{"observed_at":"2026-05-10T13:41:08.407622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mvitv2: Improved multiscale vision transformers for classification and detection","venue":null,"work_id":"be111818-ac9a-41ef-9ea2-10c39582d11f","year":2022},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:c809fa4e7d0d70630ddeacc34238fd2f44d9e53c7a16183116d5b8e6d8119d10","observation_id":"e9259743-9772-4012-a169-a6436c8abd83","resolution":{"observed_at":"2026-05-10T13:41:08.409297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"25a2d4dd-70af-4f48-8f6b-15e53b25ea48","year":2023},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:886ccf20c9268f0254d5fc25b3ff1961d92406e74cf7c015566e030685803b3e","observation_id":"a4326a14-ba66-4440-b8f4-2269e7f0dee1","resolution":{"observed_at":"2026-05-10T13:41:08.410923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06607","last_updated":"2024-08-26T06:57:51Z","snapshot_observed_at":"2026-08-05T16:46:37.436149Z","submitted_at":"2023-11-11T16:37:41Z","title":"Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models","version":4},"cited_work":{"arxiv_id":"2311.06607","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.06607","snapshot_observed_at":"2026-07-04T06:39:37.479106Z","title":"Mon- key: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"1b51b65b-5659-4d2a-b5b3-0a8ac7f88ed5","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2311.06607","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:3f146bc8ab2579ba6e62b5cfaf0a05f715caa8084229acbfdd93fc280e563431","observation_id":"3984b339-064a-43db-9912-503af55cc6e9","resolution":{"observed_at":"2026-05-10T13:41:08.362333Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14818","last_updated":"2025-01-20T18:40:47Z","snapshot_observed_at":"2026-08-11T01:59:38.596539Z","submitted_at":"2025-01-20T18:40:47Z","title":"Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2501.14818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.14818","snapshot_observed_at":"2026-07-04T00:19:12.971623Z","title":"Eagle 2: Building post-training data strategies from scratch for frontier vision-language models","venue":null,"work_id":"5cbec930-7d2e-4f47-b9c7-5d240d89a2cc","year":2025},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2501.14818","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:1f6b731bb91588250ba76a68ef7a3ea61aa6a8ba306fcdcce152cae0cdf2a0f5","observation_id":"5c37d1f1-2132-4333-af88-222f777f6598","resolution":{"observed_at":"2026-05-10T13:41:08.369391Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Let’s verify step by step","venue":null,"work_id":"11a7fb60-8684-432d-805f-72ad9979202f","year":2023},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:285a0923dd1c77e1c2ee305dc10e706ece6d14f34d7991aae6369ca0af277e71","observation_id":"7e3c5189-a7ae-4b70-aecc-3c8789e7dcf6","resolution":{"observed_at":"2026-05-10T13:41:08.420005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"48ed2542-ec0a-4954-95ee-ce2761654f90","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:847cf6d0f7318a775fec78f8c253914bba99cdcbf269baf4e63e87dcd6dc4c0e","observation_id":"112be398-657f-4b46-a2cc-051d2e6efc37","resolution":{"observed_at":"2026-05-10T13:41:08.421886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.05358","last_updated":"2022-08-10T14:08:34Z","snapshot_observed_at":"2026-08-07T21:24:23.287695Z","submitted_at":"2022-08-10T14:08:34Z","title":"CLEVR-Math: A Dataset for Compositional Language, Visual and Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":"2208.05358","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.05358","snapshot_observed_at":"2026-07-01T23:26:23.166439Z","title":"Clevr-math: A dataset for compositional language, visual and mathematical reasoning","venue":null,"work_id":"43c13df5-c90f-486d-863a-af7546a2e904","year":2022},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2208.05358","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:6f3e28a5216eda68a6641fff00ef494a23b5602bf95d1d02b0da6711c1d8157a","observation_id":"027b7536-7492-4f42-9d0e-d2ceb2612068","resolution":{"observed_at":"2026-05-10T13:41:08.372728Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning","venue":null,"work_id":"e90766ee-749f-4d3f-8519-a35f81076ebb","year":2023},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:78c3e2ded77dd4de81c08337c88a12df0185c08ecfa9f04332fe3d50a92f1828","observation_id":"0e44c233-ef2e-47ed-8809-536391a18559","resolution":{"observed_at":"2026-05-10T13:41:08.430979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"144fcfaf-2ac9-49ea-8c6f-b9292b3f1e0d","year":2025},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:cd911b3711d359cd6caccd86158419272912a9992d92959dc1d86b40ad60e079","observation_id":"cacf4376-3d67-4178-b69f-3dd2c259453a","resolution":{"observed_at":"2026-05-10T13:41:08.439770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":"2307.06281","doi":"10.48550/arxiv.2307.06281","metadata_source":"pith","pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","venue":"cs.CV","work_id":"3b44943d-0f15-4228-9ac3-0e376f4f9ada","year":2023},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:993710de33589bcabd57c182083588cbc91b833c04f645b0b7faab3439600584","observation_id":"4c8570eb-9042-47be-b7d3-e4241449b233","resolution":{"observed_at":"2026-05-12T17:20:54.147488Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-07-06T15:26:46.489500Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":"2305.07895","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-07-01T22:26:17.944984Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","venue":"cs.CV","work_id":"521163e9-4c77-4c73-8b7f-9a6aa75b6d3b","year":2023},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:8d89008606bed8fd02c23aad1873134e321a1628afbf1b3d81a607b278cbbfd2","observation_id":"cbc8a068-f9e8-4fda-8e1c-d49fe18adf14","resolution":{"observed_at":"2026-05-17T09:55:36.035986Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Acemath: Advancing frontier math reasoning with post-training and reward modeling","venue":null,"work_id":"3fa29bad-d10d-433c-a473-b943be56a018","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:a73915de0b00867967d17a0e8d5ead4ae9320b91c35e0ca7e1ac99c60b39fd1d","observation_id":"16e18c3b-2b72-4467-b02b-d442d328f963","resolution":{"observed_at":"2026-05-10T13:41:08.446557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-07-06T19:18:17.523057Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":"2409.12961","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-07-04T13:09:50.847114Z","title":"Oryx mllm: On- demand spatial-temporal understanding at arbitrary resolution","venue":null,"work_id":"4a905ca2-7426-40db-a509-3452624d3ae5","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:a019c0bdfd86ad7c7f41dc0322bde5f9430022e9b661e17c7e747e590243cc53","observation_id":"78546f28-51b5-41e9-b238-f48203b0cc7f","resolution":{"observed_at":"2026-05-10T13:41:08.381147Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scp-116k: A high-quality problem-solution dataset and a generalized pipeline for automated extraction in the higher education science domain","venue":null,"work_id":"e09ac362-b488-4599-b996-869a792ed408","year":2025},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:4d7a049b9f9ff65d1465b7998f20e6cf412dd21f8d41f50f33b0f53bd15dedbc","observation_id":"c6f1bbd5-7f6b-4ba7-ac2d-974bb218370d","resolution":{"observed_at":"2026-05-10T13:41:08.451773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":"2310.02255","doi":"10.1109/cvpr52734.2025.01245","metadata_source":"pith","pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":"cs.CV","work_id":"e22c3789-9e71-4242-b6ea-3e60e06e2b66","year":2023},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:9f00f45a34c10aa8eaeedbafff1788b8f7b5bbca194e8f6ad537aa939cecf4f7","observation_id":"4aa5ed8b-6816-413f-b710-1e86b5f59be5","resolution":{"observed_at":"2026-05-11T01:30:15.750849Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.04165","last_updated":"2021-07-20T23:22:27Z","snapshot_observed_at":"2026-08-06T13:29:31.050456Z","submitted_at":"2021-05-10T07:46:55Z","title":"Inter-GPS: Interpretable Geometry Problem Solving with Formal Language and Symbolic Reasoning","version":3},"cited_work":{"arxiv_id":"2105.04165","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2105.04165","snapshot_observed_at":"2026-07-03T19:28:52.843212Z","title":"Inter-gps: Interpretable geometry problem solving with formal language and symbolic reasoning","venue":null,"work_id":"99d7e9ec-ee77-4407-bbba-e0794ed1a869","year":2021},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2105.04165","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:4df6ef77ec6a1e891b75bfa7fbfddbd2e7d28078edd9b39b7d52bce52e824c1c","observation_id":"edf6f1d4-dce2-49f9-a15c-43dbd9a766a7","resolution":{"observed_at":"2026-05-10T13:41:08.040558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"5535cd03-6543-4894-8ed4-c27bdd04a4ea","year":2022},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:3a8c6652d733ee46c54287853dc8e571d622bb7b96fcf4a0e12b5d5dd623374d","observation_id":"9a5922a2-f8e7-4a2f-973d-420edea72035","resolution":{"observed_at":"2026-05-10T13:41:08.458109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.13214","last_updated":"2022-07-25T04:05:29Z","snapshot_observed_at":"2026-08-02T20:16:21.986025Z","submitted_at":"2021-10-25T18:52:26Z","title":"IconQA: A New Benchmark for Abstract Diagram Understanding and Visual Language Reasoning","version":4},"cited_work":{"arxiv_id":"2110.13214","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.13214","snapshot_observed_at":"2026-07-10T11:37:03.154319Z","title":"Iconqa: A new benchmark for abstract diagram understanding and visual language reasoning","venue":"cs.CV","work_id":"e5046a8f-5c72-46fd-baba-98ea6bce6d5a","year":2021},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2110.13214","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:329c3382806f1ff07eddcd26325ff3e8dd729ed4bc226255c276965cde1c629e","observation_id":"16e0f5ce-ae4c-47e4-a1fb-bc94f4fbe4aa","resolution":{"observed_at":"2026-05-10T13:41:08.043710Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-10T17:27:08.697005Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":"2405.20797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-07-04T19:50:10.268440Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":"6f4025f6-a13c-4549-b0dc-8f2bb5a5a954","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:3b41618c1c2f2c798e51b236c4dbd731ae3186ec74c6b16ed96ddb035ffd7a15","observation_id":"f4566433-df2b-4547-be0c-63e97c43124e","resolution":{"observed_at":"2026-05-10T13:41:08.046852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10640","last_updated":"2024-11-16T00:14:51Z","snapshot_observed_at":"2026-08-04T22:40:20.902372Z","submitted_at":"2024-11-16T00:14:51Z","title":"BlueLM-V-3B: Algorithm and System Co-Design for Multimodal Large Language Models on Mobile Devices","version":1},"cited_work":{"arxiv_id":"2411.10640","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.10640","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bluelm-v-3b: Algorithm and system co-design for multimodal large language models on mobile devices","venue":null,"work_id":"0d815239-72b5-4232-a9af-f984cb26afef","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2411.10640","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:77a3d5adea38985d988dfc4d329aada2d34f5d53ca36d55f371d90043ddecfa7","observation_id":"50d1bb8a-1bda-4b21-8f31-ac3177e5c7f9","resolution":{"observed_at":"2026-05-10T13:41:08.049836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11069","last_updated":"2024-06-16T20:53:25Z","snapshot_observed_at":"2026-08-06T16:39:25.477229Z","submitted_at":"2024-06-16T20:53:25Z","title":"WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences","version":1},"cited_work":{"arxiv_id":"2406.11069","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11069","snapshot_observed_at":"2026-07-01T22:36:16.753738Z","title":"Wildvision: Evaluating vision-language models in the wild with human preferences","venue":null,"work_id":"b51d8a66-b89d-4bc9-99d4-e7ddf9f8b9f9","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2406.11069","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:c057a88d20860a4d2e9092ae676943b602c6f6e744c17fb2de230746082012c0","observation_id":"2b254b4a-fbad-4a33-8c1f-dc89cd8c24f3","resolution":{"observed_at":"2026-05-10T13:41:08.056502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":"2406.06592","doi":"10.48550/arxiv.2406.06592","metadata_source":"pith","pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","venue":"cs.CL","work_id":"9906447b-5bb3-4367-91f9-b9d556c9ee7f","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:34a8db6764848e8404e827024fc743cd986dfe6196ac2ebde6e182bac2b2ccdc","observation_id":"3296f90c-8885-472d-a340-987a6d7f00a5","resolution":{"observed_at":"2026-05-13T20:53:45.995574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":"ee50a6cd-2e2b-44ff-bf4f-6ea0262c0270","year":2016},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:c0659b9ca86ce021eb6fb9b67fefc40840950b27c6dc88fb9fba2b8525f04e2c","observation_id":"6f9fd756-dd20-4ea3-bf3f-de1e663be830","resolution":{"observed_at":"2026-05-10T13:41:08.479426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"cited_work":{"arxiv_id":"2504.05299","doi":"10.18653/v1/2025.acl-long.718","metadata_source":"pith","pith_arxiv_id":"2504.05299","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SmolVLM: Redefining small and efficient multimodal models","venue":"cs.AI","work_id":"810cc87f-f6bd-4443-9673-5e30982426b9","year":2025},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2504.05299","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:f59927dbd0b93824c04e0cd2d7060bbe753d2c8b0cd285313e74454c4c179d0e","observation_id":"7c025a5f-c007-4400-a17c-1a43417b5062","resolution":{"observed_at":"2026-05-13T20:23:51.804797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"8ca91d7a-02c6-4afe-89dd-3d5900fc6903","year":2019},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:56e65a445fa5146ae2cde5615298d671537a025735e654da4a37c6f27aa44ee5","observation_id":"e2b99258-9630-4cc9-98c8-43525eddabcb","resolution":{"observed_at":"2026-05-10T13:41:08.387631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":"47118e23-053a-4a33-9d3b-ce9639376b26","year":2022},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:c44b35c12d32e4de27f4aeb2eb91faf089703a5f3fb9b5bedf23b1d85a4d18bf","observation_id":"7a9a8293-78e7-4bf0-ab5e-7b079d1fadb9","resolution":{"observed_at":"2026-05-10T13:41:08.389598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Infographicvqa","venue":null,"work_id":"5a500c68-2e72-427c-ae53-b21484770a48","year":2022},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:4e1c565139d12eb611b46cb93eecadc26b103fc0c90ce4470f1d90871fd4e88e","observation_id":"1a202c3a-cd35-4fe1-aaa8-f723909d9df5","resolution":{"observed_at":"2026-05-10T13:41:08.391383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"18f6a763-0393-4299-a97e-68a5206e9719","year":2021},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:4ef0ec486cc5ddec3444844b888bf962fad796869b673fb9147f3acf19783e64","observation_id":"fc41b8a2-3aa1-4bda-8acc-14efe6d738f8","resolution":{"observed_at":"2026-05-10T13:41:08.402281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-08-11T03:58:36.716204Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":"2407.00215","doi":"10.48550/arxiv.2407.00215","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLM Critics Help Catch LLM Bugs","venue":"arXiv (Cornell University)","work_id":"e730c1aa-4c9b-48f3-923b-47ddc0a4e6d8","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:c2a2059684e4e9c5d84281592c4c44deff0503e44084a85e23b463c53535c574","observation_id":"ee956037-fb1a-4883-9db4-5f2edfa415a8","resolution":{"observed_at":"2026-05-10T13:41:08.064965Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02718","last_updated":"2024-08-05T17:56:41Z","snapshot_observed_at":"2026-07-06T18:57:09.545013Z","submitted_at":"2024-08-05T17:56:41Z","title":"MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2408.02718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.02718","snapshot_observed_at":"2026-07-03T10:48:03.008078Z","title":"Mmiu: Multimodal multi-image understanding for evaluating large vision-language models","venue":null,"work_id":"b17cb70e-01bb-44ed-8894-a56ed0cbb0c8","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2408.02718","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:46dcc0c051b1c5681c22d36b07d2b9e19119c444ccb11c218aaed617fa2c78c3","observation_id":"9ff29946-03b1-4140-bb99-fcbb4ebea566","resolution":{"observed_at":"2026-05-10T13:41:08.067886Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":"063710b1-ae55-4d07-b498-01086f4c7244","year":2019},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:82a00dae312d788b157a75efb5d717ed8540f6c3e8c68a98953ef338f785a194","observation_id":"53ffb316-dd3d-4bcd-9465-b5f05e34d038","resolution":{"observed_at":"2026-05-10T13:41:08.414450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":"85f216d7-0dcc-458d-8cca-3297b77d2f50","year":null},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:7d52398a86cb9c0522bb141fc434de81837481048cd373c8fc7b8b4c38e77e02","observation_id":"aa8fb495-d1be-44c2-9a5b-44455e210b93","resolution":{"observed_at":"2026-05-10T13:41:08.416484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"56ab20d3-e6cb-4cc5-aa60-47ab1a599f95","year":null},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:0fe12cd16bfeb48b0618039a8c86e16af3be872cc49f806cd98ee45a80c867e5","observation_id":"2965058a-3ca8-4656-ad6a-724504d790ef","resolution":{"observed_at":"2026-05-10T13:41:08.425663Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-4o system card","venue":null,"work_id":"c8133589-feb6-4063-8756-10c1632fdb07","year":2025},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:a9c5009ba6b35c52bdac6294d6770f77edca7234af94992193224940d3ada8d0","observation_id":"23cea178-7685-4b9a-b84e-6bc3ed66b0a6","resolution":{"observed_at":"2026-05-10T13:41:08.441272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":"2407.01284","doi":"10.48550/arxiv.2407.01284","metadata_source":"pith","pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","venue":"cs.AI","work_id":"36b1b11c-2612-4d1d-9a6e-7db18eca4a25","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:00731a4e4388612ff1fb41631830261c8268a0f864f459a4fefe2f2d5d2a764c","observation_id":"91ef0e03-403d-4559-b0fb-82f687bd6a8f","resolution":{"observed_at":"2026-05-16T21:55:41.398838Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":"2501.12326","doi":"10.48550/arxiv.2501.12326","metadata_source":"pith","pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","venue":"cs.AI","work_id":"0bbcf263-a46d-4525-a438-11fce3316568","year":2025},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:66be4b196bb0dd72026f2651054640a40d5a065fba6ddad861229ebcd054e0cc","observation_id":"eafb055f-075c-42e3-9559-2f6650fb124f","resolution":{"observed_at":"2026-05-10T13:41:08.074041Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:19.638951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:19.638951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Direct preference optimization: Your language model is secretly a reward model.Advances in Neural Information Processing Systems, 36","venue":null,"work_id":"7d05deb9-5e36-4cf5-b2fc-4f61e1c9a233","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:f2380886def1b3229e977e29760e122282bfe7c8e682b86c0e298fda1d020dd9","observation_id":"26ecea0e-3d97-473e-863f-5c16f2e232c2","resolution":{"observed_at":"2026-05-10T13:41:08.453953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":1,"verified_exact":53,"verified_fuzzy":43},"total_outbound_references":154},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 100 of 154 outbound references and 100 inbound Pith citation observations for arXiv:2504.10479."}