{"as_of":"2026-08-11T06:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:218dc183029a0ed7af9859668308ff7cf7a81e4a433b88e0fc4fbef903920ece","coverage":[{"denominator":300,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T13:23:57.588851Z","state":"measured"},{"denominator":200,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":200,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":585,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:07:14.402030Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":14,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2412.04454","last_updated":"2025-05-05T16:17:20Z","snapshot_observed_at":"2026-07-06T20:02:21.509050Z","submitted_at":"2024-12-05T18:58:26Z","title":"Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-18T04:09:41.494136Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2412.04454"},"observation_digest":"sha256:366c2b59f598ca22fc0a6823523719c27437e240adfd096c71580a9393b26475","observation_id":"dbf3dc5f-04ef-452f-b47e-d9e69ed2731a","resolution":{"observed_at":"2026-05-18T04:09:41.571937Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-10T23:07:14.402030Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test- time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.21080","last_updated":"2024-12-30T16:57:05Z","snapshot_observed_at":"2026-08-10T23:00:36.632749Z","submitted_at":"2024-12-30T16:57:05Z","title":"Vinci: A Real-time Embodied Smart Assistant based on Egocentric Vision-Language Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:14.402030Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2412.21080"},"observation_digest":"sha256:3a14c2cdaa18906ab31d0f07d8fe57c33d0ded87e4ae231f7292bddb98521fe2","observation_id":"4a4005a2-c553-4284-93bf-4d199e027499","resolution":{"observed_at":"2026-08-10T23:07:14.402030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-07T17:13:10.057242Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T20:33:26.613927Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2501.00321"},"observation_digest":"sha256:f5a401118622adc55a27daadc546e247c2625fa7def8b0f8b2534ede67bc7a39","observation_id":"fe5de7f2-d8da-4945-9db7-4404a8086643","resolution":{"observed_at":"2026-05-17T20:33:26.755761Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-10T22:52:00.747316Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test- time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00513","last_updated":"2025-03-18T16:01:24Z","snapshot_observed_at":"2026-08-10T22:46:57.431139Z","submitted_at":"2024-12-31T15:53:50Z","title":"CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:52:00.747316Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2501.00513"},"observation_digest":"sha256:a5dcfe6546471db4a250c954b53245560f5cdf2f2dbe4054b71e74e0f2b09f01","observation_id":"4b69a1b7-2758-4655-b24f-0ec49c7eaa31","resolution":{"observed_at":"2026-08-10T22:52:00.747316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T04:02:43.261543Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2501.00574"},"observation_digest":"sha256:610d3eba9d7c3aaa478fbaccdced8bfc0abb7f022270bc7bb7910bb826f1dfd2","observation_id":"db4489fd-e6fb-47cb-98ff-2ea6d77c59d0","resolution":{"observed_at":"2026-05-18T04:02:43.692536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-10T22:27:56.494682Z","title":"Expanding performance boundaries of open- source multimodal models with model, data, and test-time scaling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01645","last_updated":"2025-05-13T06:38:44Z","snapshot_observed_at":"2026-08-10T23:44:47.423609Z","submitted_at":"2025-01-03T05:32:37Z","title":"HLV-1K: A Large-scale Hour-Long Video Benchmark for Time-Specific Long Video Understanding","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:56.494682Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2501.01645"},"observation_digest":"sha256:f718c6754e8ca30c538c8ab87c3b4506a18fc61749a482e67bf6e8f766dad8ba","observation_id":"d5cdff0d-953d-440d-997d-61b082553ac0","resolution":{"observed_at":"2026-08-10T22:27:56.494682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-08-08T01:58:42.644918Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T11:39:22.340737Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2501.04001"},"observation_digest":"sha256:be8cf58385c2a8b691af6cae3dad046d4a8e44d697609d228800a13fb0ffaaad","observation_id":"fdfc9d99-3ca6-4c53-8d07-d375493f4258","resolution":{"observed_at":"2026-05-16T11:39:22.419329Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-10T21:31:15.878718Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04670","last_updated":"2025-07-09T08:04:21Z","snapshot_observed_at":"2026-08-11T01:32:03.608835Z","submitted_at":"2025-01-08T18:30:53Z","title":"Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:31:15.878718Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2501.04670"},"observation_digest":"sha256:88b9b72b35a4cb29a9d438926c12af6e78d8790cf6ad5d40cd433db51c6091aa","observation_id":"087cd7be-d6e1-4c05-b617-a14ff3b46f4a","resolution":{"observed_at":"2026-08-10T21:31:15.878718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2501.05067","last_updated":"2026-04-20T07:42:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-09T08:43:57Z","title":"LLaVA-Octopus: Unlocking Instruction-Driven Adaptive Projector Fusion for Video Understanding","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-23T06:01:00.775721Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2501.05067"},"observation_digest":"sha256:08132bf67da33baf9fe932c97bde6fabda54d16906bc87fb7875bce4fa66e28f","observation_id":"c85b112d-5f3d-4c60-b896-0c86dd59248e","resolution":{"observed_at":"2026-05-23T06:02:37.386976Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-10T21:18:59.495233Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test- time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-10T21:11:43.711209Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:59.495233Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2501.05444"},"observation_digest":"sha256:a54e106c5a678f9b5bef0169b5e44da02c604e88708caa5f9212a6b4260b32ce","observation_id":"e14bc7da-57d3-437f-930e-d95c1e01be9e","resolution":{"observed_at":"2026-08-10T21:18:59.495233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-10T21:10:18.883573Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05901","last_updated":"2025-01-13T02:34:19Z","snapshot_observed_at":"2026-08-10T21:04:00.512365Z","submitted_at":"2025-01-10T11:53:46Z","title":"Valley2: Exploring Multimodal Models with Scalable Vision-Language Design","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:18.883573Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2501.05901"},"observation_digest":"sha256:fac0da90482c95ec61e55cd35bc688f67058cc02dcab8f8bc7ef3cf11b953ee1","observation_id":"07d3c61f-97c8-43a9-b894-6fb073d2041b","resolution":{"observed_at":"2026-08-10T21:10:18.883573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-10T20:39:35.338553Z","title":"Expanding performance boundaries of open- source multimodal models with model, data, and test-time scaling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07783","last_updated":"2025-01-14T01:57:41Z","snapshot_observed_at":"2026-08-11T01:32:14.336933Z","submitted_at":"2025-01-14T01:57:41Z","title":"Parameter-Inverted Image Pyramid Networks for Visual Perception and Multimodal Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:39:35.338553Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2501.07783"},"observation_digest":"sha256:6a17429ae22113407bd22c66de086ac4fa236e6949e34daabda66a40c41eb061","observation_id":"f56fa86e-db31-4618-a2a3-65e0feffd7b9","resolution":{"observed_at":"2026-08-10T20:39:35.338553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-10T20:03:12.706160Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test- time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09502","last_updated":"2025-01-16T12:27:05Z","snapshot_observed_at":"2026-08-10T19:55:29.245089Z","submitted_at":"2025-01-16T12:27:05Z","title":"Omni-Emotion: Extending Video MLLM with Detailed Face and Audio Modeling for Multimodal Emotion Analysis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:03:12.706160Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2501.09502"},"observation_digest":"sha256:a4aede39c7a60605f7d47151f472af50494420966d9d5dd3d78e85fb47d377ee","observation_id":"03ae5b0e-f7eb-4be8-9daf-d4fa9ce6d87b","resolution":{"observed_at":"2026-08-10T20:03:12.706160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-10T20:00:12.574172Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09532","last_updated":"2025-02-01T06:13:27Z","snapshot_observed_at":"2026-08-10T19:53:11.323533Z","submitted_at":"2025-01-16T13:34:33Z","title":"AdaFV: Rethinking of Visual-Language alignment for VLM acceleration","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T20:00:12.574172Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2501.09532"},"observation_digest":"sha256:2e3ec45d95e7f60fc883c42951a04c0b28c2392df99fb7a88571a4e33f8d1f1f","observation_id":"fdacd6b9-e11a-4829-a704-0402494f65ce","resolution":{"observed_at":"2026-08-10T20:00:12.574172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-10T19:48:22.445114Z","title":"Expanding per- formance boundaries of open-source multimodal models with model, data, and test-time scaling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09720","last_updated":"2025-01-31T21:29:40Z","snapshot_observed_at":"2026-08-10T19:40:55.496877Z","submitted_at":"2025-01-16T18:09:22Z","title":"A Simple Aerial Detection Baseline of Multimodal Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T19:48:22.445114Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2501.09720"},"observation_digest":"sha256:92ac4f9e880e0b4484006abf9e74d5867992db8b9e63fcb34b25a52549e3b508","observation_id":"d12f5c2c-075e-46f1-a857-0347cf2ed681","resolution":{"observed_at":"2026-08-10T19:48:22.445114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-10T17:51:06.874624Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11833","last_updated":"2025-01-21T02:29:15Z","snapshot_observed_at":"2026-08-10T17:46:23.730818Z","submitted_at":"2025-01-21T02:29:15Z","title":"Is your LLM trapped in a Mental Set? Investigative study on how mental sets affect the reasoning capabilities of LLMs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T17:51:06.874624Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2501.11833"},"observation_digest":"sha256:d89ae6e6c9c311f341f4f4bc211f64e341c76375400ba31749e28eadd5a193ec","observation_id":"8514a535-74bc-4bba-ac64-6b00fd3a5803","resolution":{"observed_at":"2026-08-10T17:51:06.874624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-10T17:18:40.020319Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-10T21:22:00.940261Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:40.020319Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:8a8bc485a220d476d33b0f37fd0c437801509cf645e071c356ea11106fa36a46","observation_id":"fdbc36e7-7bd3-4698-8f73-99efc9412160","resolution":{"observed_at":"2026-08-10T17:18:40.020319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T01:19:59.603343Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2501.13106"},"observation_digest":"sha256:e6a63038724c04bfe188047cb9ca0cec2384c725f39023af616895a0fd9b1ce8","observation_id":"9bc5ee28-ccce-48cb-8d24-fbf9ab89ec04","resolution":{"observed_at":"2026-05-11T01:19:59.991095Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-10T14:23:33.436247Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15415","last_updated":"2025-05-22T08:23:17Z","snapshot_observed_at":"2026-08-10T14:16:38.180115Z","submitted_at":"2025-01-26T06:14:29Z","title":"OCSU: Optical Chemical Structure Understanding for Molecule-centric Scientific Discovery","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T14:23:33.436247Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2501.15415"},"observation_digest":"sha256:e5812a522fb591ae436645e9499413cfeface8904dd630f91594e6d025527600","observation_id":"6d0295fd-ec2e-40ef-b063-7e45bdf771de","resolution":{"observed_at":"2026-08-10T14:23:33.436247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-10T14:14:54.622105Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15558","last_updated":"2025-01-26T15:20:39Z","snapshot_observed_at":"2026-08-10T14:08:06.447128Z","submitted_at":"2025-01-26T15:20:39Z","title":"Ocean-OCR: Towards General OCR Application via a Vision-Language Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T14:14:54.622105Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2501.15558"},"observation_digest":"sha256:2699cf70a25cd22bd0d1f3567080d8dbfc6deef690b4d1f1c9b8c9db085a24b7","observation_id":"bba54c0c-287d-494f-aa6e-d45ed753f2dc","resolution":{"observed_at":"2026-08-10T14:14:54.622105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-09T20:17:40.316184Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00094","last_updated":"2025-02-04T18:05:23Z","snapshot_observed_at":"2026-08-09T20:12:12.264429Z","submitted_at":"2025-01-31T18:58:20Z","title":"AIN: The Arabic INclusive Large Multimodal Model","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T20:17:40.316184Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2502.00094"},"observation_digest":"sha256:99e2c4bdffe76aed6537f6da4d68567d3b4ec3936f6ee8a12601992262cdf08f","observation_id":"7a099e45-6051-4743-a87f-585d228c25a1","resolution":{"observed_at":"2026-08-09T20:17:40.316184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-08T23:20:00.987901Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04176","last_updated":"2025-04-21T12:02:08Z","snapshot_observed_at":"2026-08-09T17:33:47.070390Z","submitted_at":"2025-02-06T16:07:24Z","title":"MRAMG-Bench: A Comprehensive Benchmark for Advancing Multimodal Retrieval-Augmented Multimodal Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T23:20:00.987901Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2502.04176"},"observation_digest":"sha256:60365420ce6dc5aa5ed4db1b0ac6df529bf51807e7ce9acfeb03b6b0f4b478fa","observation_id":"43321dff-4be8-48d7-8055-8195a6e15781","resolution":{"observed_at":"2026-08-08T23:20:00.987901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T05:53:26.066674Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2502.04326"},"observation_digest":"sha256:cfd2114bdf0fb018c595ee12bb67b4b7ef24180f904830a242c2d1718e33f4d3","observation_id":"2193c28a-8434-4b28-9561-5bd00eefe9ad","resolution":{"observed_at":"2026-05-17T05:53:26.373635Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-08T22:47:39.073045Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test- time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-10T02:46:21.304913Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.073045Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:b61e57d39939b63d528b5777c7914ecad1f71b4da6b7d7f338894717ecfdc764","observation_id":"d3d61bf3-5cef-4116-b793-1bcec186b665","resolution":{"observed_at":"2026-08-08T22:47:39.073045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-08T10:14:30.118925Z","title":"arXiv preprint arXiv:2412.05271","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08168","last_updated":"2025-03-04T01:07:55Z","snapshot_observed_at":"2026-08-10T09:40:35.901381Z","submitted_at":"2025-02-12T07:19:36Z","title":"SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T10:14:30.118925Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2502.08168"},"observation_digest":"sha256:9bf22845f0d93a7844ca8408ec210a6df8c57ae50a705e9e847e1ba30bcc14fd","observation_id":"3e497a2f-7f7b-4020-a666-7df7f524aa32","resolution":{"observed_at":"2026-08-08T10:14:30.118925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T22:05:56.815330Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09285","last_updated":"2025-02-13T13:00:33Z","snapshot_observed_at":"2026-08-09T01:06:48.912790Z","submitted_at":"2025-02-13T13:00:33Z","title":"EmoAssist: Emotional Assistant for Visual Impairment Community","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T22:05:56.815330Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2502.09285"},"observation_digest":"sha256:e6de774ebd35805c38b7bc3303449cfe3957cdd375b73e91212ff0d05bcdbd77","observation_id":"a0a61174-98ae-4d45-a0c6-b7deacda45be","resolution":{"observed_at":"2026-08-07T22:05:56.815330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-23T02:25:04.405036Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2502.13923"},"observation_digest":"sha256:41f70e9cde60318f1cdc25d2f1c074d915bd9411ce596a0b8359728172041b2d","observation_id":"be40dd94-a9cd-4805-a809-abc0d8a832aa","resolution":{"observed_at":"2026-05-23T02:25:19.071625Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-08-09T11:59:10.408717Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T22:22:27.455361Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2503.01743"},"observation_digest":"sha256:3b01a8a2bf8aa1b1e161dbdaa9a9f4e828f1332d980ebf22f175a7ba0eaed9f3","observation_id":"3a059973-2a2b-4636-9b9f-9ab0c3887ebe","resolution":{"observed_at":"2026-05-11T22:22:27.842608Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-04T23:08:22.516431Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T15:09:24.367362Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2503.06669"},"observation_digest":"sha256:08ad696d6d96b2f5aadbbd3db1d0cc85dc72c1e51d74648868cbd736cc7682c4","observation_id":"4cdad193-8e50-4b67-9043-fa2598f9f8e8","resolution":{"observed_at":"2026-05-11T15:09:24.633068Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2503.07608","last_updated":"2025-03-10T17:59:42Z","snapshot_observed_at":"2026-08-01T16:55:41.453922Z","submitted_at":"2025-03-10T17:59:42Z","title":"AlphaDrive: Unleashing the Power of VLMs in Autonomous Driving via Reinforcement Learning and Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T20:06:27.136345Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2503.07608"},"observation_digest":"sha256:fac942c0e6614a8ccec1b1a5e104791c6a8fdb660bda68e83d11216180a99343","observation_id":"27815057-470f-436b-8557-88f2dbea35fa","resolution":{"observed_at":"2026-05-16T20:06:27.187089Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-07T12:50:27.666060Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T00:19:20.462455Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2503.10615"},"observation_digest":"sha256:6f67cad613e079e47abbd4fe3506e5fe00bf4865ba79d8071a7a4bcfbc9caf9b","observation_id":"4cf32f77-ca1b-417f-aa46-6735afb14994","resolution":{"observed_at":"2026-05-16T00:19:20.612554Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":272,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:7b3d9678eabd009d6bccffbf35f24a94cdb673376259758e6acc3497254cffbf","observation_id":"454d47c7-8dd6-4678-8e23-d5621c470468","resolution":{"observed_at":"2026-05-15T17:18:53.605459Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2503.15558","last_updated":"2025-05-19T17:59:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T22:06:58Z","title":"Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T12:47:10.146795Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2503.15558"},"observation_digest":"sha256:924f26c9aa8be8d4ef9701363ee3c7dd6d31f13e8ba26c29ebb9242c8cd9758d","observation_id":"715acb0e-a21b-4696-a749-b7d8769192c9","resolution":{"observed_at":"2026-05-16T12:47:10.200336Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2503.16549","last_updated":"2026-04-18T11:44:37Z","snapshot_observed_at":"2026-08-08T08:24:44.422314Z","submitted_at":"2025-03-19T11:46:19Z","title":"MathFlow: Enhancing the Perceptual Flow of MLLMs for Visual Mathematical Problems","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T22:55:34.238427Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2503.16549"},"observation_digest":"sha256:f76c2ab1914902080453855a289595c931477e09a9f08598d6988022ac620bac","observation_id":"f62fed40-d4c2-4ab0-b2b4-19a60f7d09ad","resolution":{"observed_at":"2026-05-22T22:57:13.284486Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T06:59:03.112252Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2503.17352"},"observation_digest":"sha256:c7774c2233ac9081b3b636655ffccb1064459ee874eea0f78f00ea6ef0e2ae72","observation_id":"d00c3be7-a55c-4580-b867-4b22d5693751","resolution":{"observed_at":"2026-05-19T06:59:03.365351Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2504.01805","last_updated":"2025-05-21T09:38:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-02T15:12:17Z","title":"SpaceR: Reinforcing MLLMs in Video Spatial Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T15:18:43.724432Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2504.01805"},"observation_digest":"sha256:201d487acf0cdcb54b9aca3155006d49ee4694b031fcc23253a130dc2b50d7cc","observation_id":"413e1df8-f063-46eb-9398-5b712199bbec","resolution":{"observed_at":"2026-05-15T15:18:43.827202Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:fb3b3e2edfb7f4a555a8664395d21392b5f4bb9c4d2b476b0d55af04d8955fe8","observation_id":"f97b9fff-840d-4c74-a7a3-fb38cd2134f6","resolution":{"observed_at":"2026-05-13T01:13:57.530850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:7682d1aa954e6ba495ea4da51c6a498c7d592d5bda132e14052185becbb8897f","observation_id":"dca35e67-146b-42ea-926a-304bbc25abee","resolution":{"observed_at":"2026-05-10T13:41:08.239742Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2504.11101","last_updated":"2026-05-06T07:49:45Z","snapshot_observed_at":"2026-07-06T21:09:40.867591Z","submitted_at":"2025-04-15T11:51:18Z","title":"Consensus Entropy: Harnessing Multi-VLM Agreement for Self-Verifying and Self-Improving OCR","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T20:31:34.074705Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2504.11101"},"observation_digest":"sha256:f44f05e6c70b8caadbd1be31814c5386abc41090268bcedcbbf0626ae67a6537","observation_id":"2ab87385-289b-4fe2-a7e0-3b51be7dd4cc","resolution":{"observed_at":"2026-05-22T20:32:04.684976Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2504.13181","last_updated":"2025-04-28T18:01:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T17:59:57Z","title":"Perception Encoder: The best visual embeddings are not at the output of the network","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T22:21:15.681336Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2504.13181"},"observation_digest":"sha256:39567de29e5c1accb7803169d9230af82f087ad0d1cea3dcd7299faf3ee0b5f5","observation_id":"57bd24ad-6817-4225-ace8-5877e4367350","resolution":{"observed_at":"2026-05-13T22:21:15.752203Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2504.17180","last_updated":"2026-04-03T02:52:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-24T01:34:12Z","title":"We'll Fix it in Post: Improving Text-to-Video Generation with Neuro-Symbolic Feedback","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T18:56:39.735334Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2504.17180"},"observation_digest":"sha256:1f6c262fe109e702d9e2ec36ff14aa040809d86f5a46b0f13609ade02d9951ab","observation_id":"ec1683fa-ebdf-461b-bfa0-47116c0ab52a","resolution":{"observed_at":"2026-05-22T18:56:58.261190Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T15:42:31.399503Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13965","last_updated":"2025-05-20T06:05:56Z","snapshot_observed_at":"2026-08-09T01:02:45.725414Z","submitted_at":"2025-05-20T06:05:56Z","title":"CAFES: A Collaborative Multi-Agent Framework for Multi-Granular Multimodal Essay Scoring","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:31.399503Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.13965"},"observation_digest":"sha256:5724584aa85f6283a7685f02cd7dfd49eb6f1cd7e84464bee4632458fbb8d086","observation_id":"48eafba0-689d-44b6-a352-d9810ad2d040","resolution":{"observed_at":"2026-08-07T15:42:31.399503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T15:43:21.649314Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14035","last_updated":"2025-05-20T07:31:17Z","snapshot_observed_at":"2026-08-10T02:31:04.491866Z","submitted_at":"2025-05-20T07:31:17Z","title":"ShieldVLM: Safeguarding the Multimodal Implicit Toxicity via Deliberative Reasoning with LVLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:21.649314Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.14035"},"observation_digest":"sha256:d3ffb95113cb4cf59e45c7272bb5f48bef1adfe03f9930890c5558f60b3895a1","observation_id":"fcbff939-49af-4d50-8fd5-c9dad6aed463","resolution":{"observed_at":"2026-08-07T15:43:21.649314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T15:42:25.897449Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-07T17:35:55.668492Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:25.897449Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:622602dc9a9e8c8c3c1b9634c876340138d9b1d371fbf94abf4f5df75883d0d2","observation_id":"1bb37353-e8cb-4ac9-86bc-d6b8d4ebf0d1","resolution":{"observed_at":"2026-08-07T15:42:25.897449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2505.14362","last_updated":"2026-03-01T04:59:56Z","snapshot_observed_at":"2026-08-02T12:23:34.946873Z","submitted_at":"2025-05-20T13:48:11Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T14:42:56.565621Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.14362"},"observation_digest":"sha256:186d97239a88a59354ee2a36f80fcf4abe53856aa4426c055ac2dba431460a8e","observation_id":"bce2c6ed-8e9d-463c-b9df-bb33676dc6c4","resolution":{"observed_at":"2026-05-11T14:42:56.719011Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T15:36:56.449803Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14603","last_updated":"2025-05-20T16:52:11Z","snapshot_observed_at":"2026-08-08T09:50:55.129813Z","submitted_at":"2025-05-20T16:52:11Z","title":"Towards a Foundation Model for Communication Systems","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:36:56.449803Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.14603"},"observation_digest":"sha256:489e5ba0581c99e597a654a47125ce3c9890a1ed286719bcd9362540686cc9b4","observation_id":"b9eae6d5-b575-4723-9821-2e20512be1e8","resolution":{"observed_at":"2026-08-07T15:36:56.449803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T15:34:44.518133Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14640","last_updated":"2025-05-20T17:26:32Z","snapshot_observed_at":"2026-08-10T08:26:12.719387Z","submitted_at":"2025-05-20T17:26:32Z","title":"VideoEval-Pro: Robust and Realistic Long Video Understanding Evaluation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:44.518133Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.14640"},"observation_digest":"sha256:06b7ad0bc3afbbaff56bf47acdde6d1f3de85c1f17e834d5105f10fd8b353ef2","observation_id":"5d0872ad-c2e1-40e5-a047-d42e50b38f36","resolution":{"observed_at":"2026-08-07T15:34:44.518133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-11T02:56:05.992492Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T16:23:41.854132Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.14683"},"observation_digest":"sha256:88f75bb3636c603cece3c56a5b0bfccdfe3a2a873929b29ff3a56a819d6c54ae","observation_id":"79f87b93-d215-452b-a229-07b36248cee7","resolution":{"observed_at":"2026-05-10T16:23:41.995166Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T15:20:44.667515Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:44.667515Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:6614c6ebc44dd50192e9b79f348b443a58b75230c75d5164bf429b1e92327639","observation_id":"aeb95aec-7c5b-48a8-9143-5c9c25861d5b","resolution":{"observed_at":"2026-08-07T15:20:44.667515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T15:15:41.300013Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-10T13:20:59.425681Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:41.300013Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:8de2d2844bd69d58a9e7bfc7b541910f27226e83bb54863205801ff9e5a17c73","observation_id":"b1d57b38-53f5-49c4-a16d-20c220232ee3","resolution":{"observed_at":"2026-08-07T15:15:41.300013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T15:13:57.151656Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16151","last_updated":"2025-05-22T02:51:12Z","snapshot_observed_at":"2026-08-08T23:52:03.283523Z","submitted_at":"2025-05-22T02:51:12Z","title":"Training-Free Reasoning and Reflection in MLLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:57.151656Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.16151"},"observation_digest":"sha256:1ec9f5741278111f9b2032d2fb4ae064b08f03b9a4e300bb6424dce64abcf68e","observation_id":"294efcf3-6fe5-4ed8-bcf1-da716dec89ff","resolution":{"observed_at":"2026-08-07T15:13:57.151656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T15:08:58.336854Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16175","last_updated":"2025-05-31T13:43:36Z","snapshot_observed_at":"2026-08-08T10:58:05.073646Z","submitted_at":"2025-05-22T03:26:50Z","title":"QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:08:58.336854Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.16175"},"observation_digest":"sha256:d8fd894591df47c5153f50973fb2bcbf4284a79befd83c9f3589b5fc06ac3097","observation_id":"cfd80a0d-2535-4e0e-8341-55ac8772c364","resolution":{"observed_at":"2026-08-07T15:08:58.336854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T15:09:19.079742Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16181","last_updated":"2025-05-26T00:10:44Z","snapshot_observed_at":"2026-08-09T09:40:58.395063Z","submitted_at":"2025-05-22T03:35:15Z","title":"Understanding Generative AI Capabilities in Everyday Image Editing Tasks","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:19.079742Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.16181"},"observation_digest":"sha256:76b199fa92c840293433c5d975b89dfe0d2e64c5ab0a20fc1f0d72aa567bddc9","observation_id":"f10b55dc-d9f9-484d-b772-14fa6ab0c3ed","resolution":{"observed_at":"2026-08-07T15:09:19.079742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T15:09:42.460938Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test- time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16314","last_updated":"2025-05-22T07:12:36Z","snapshot_observed_at":"2026-08-07T21:47:57.996975Z","submitted_at":"2025-05-22T07:12:36Z","title":"NTIRE 2025 challenge on Text to Image Generation Model Quality Assessment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:42.460938Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.16314"},"observation_digest":"sha256:2db1a210c2eaf280376867f9667d7c1bc8aea4a2b95e217b2125ba924adff8c4","observation_id":"a075c7a6-6f15-4551-b397-40d6859966ba","resolution":{"observed_at":"2026-08-07T15:09:42.460938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:c0ac3908cce0cd1fe8cb544a9ffd66e0d37724dddb607211298dca6477d007f2","observation_id":"050d2c3b-ca16-4e0d-857b-5540d678d2de","resolution":{"observed_at":"2026-05-22T14:21:39.737877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T15:02:25.132191Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16579","last_updated":"2025-05-22T12:14:23Z","snapshot_observed_at":"2026-08-09T20:20:59.205626Z","submitted_at":"2025-05-22T12:14:23Z","title":"Bridging the Dynamic Perception Gap: Training-Free Draft Chain-of-Thought for Dynamic Multimodal Spatial Reasoning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:02:25.132191Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.16579"},"observation_digest":"sha256:e2ae3abf0b4a8b7a2bd685f546cd4059c9a0a4e26bb3719c3e1da0aa310fa87c","observation_id":"724ccaf1-5152-4020-b225-fbaa6e536ca7","resolution":{"observed_at":"2026-08-07T15:02:25.132191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:55:25.989364Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16915","last_updated":"2026-05-31T14:25:23Z","snapshot_observed_at":"2026-08-07T14:50:38.755910Z","submitted_at":"2025-05-22T17:11:27Z","title":"DetailMaster: Can Your Text-to-Image Model Handle Long Prompts?","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:25.989364Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.16915"},"observation_digest":"sha256:a0f18fe007fc69c4c1a4ca4717e603a69531a45c4f4916411e846530efc2dfe6","observation_id":"13a8bef6-d4c6-4bb7-9e4f-450488504528","resolution":{"observed_at":"2026-08-07T14:55:25.989364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:56:48.792555Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16916","last_updated":"2025-05-22T17:11:58Z","snapshot_observed_at":"2026-08-09T17:32:27.997542Z","submitted_at":"2025-05-22T17:11:58Z","title":"Backdoor Cleaning without External Guidance in MLLM Fine-tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:48.792555Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.16916"},"observation_digest":"sha256:9103b9e06be37b3cc4af99a2a0539df842ff4076c8327f87a4222bb0e257d9c0","observation_id":"df65dd4a-7c41-4556-91b1-3026e5e6bdad","resolution":{"observed_at":"2026-08-07T14:56:48.792555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2505.17012","last_updated":"2026-04-13T12:33:41Z","snapshot_observed_at":"2026-07-06T21:28:43.610849Z","submitted_at":"2025-05-22T17:59:03Z","title":"SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-22T13:07:11.548885Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.17012"},"observation_digest":"sha256:06bbf3ac1eda101670945f5adb67278b7d0e9fda47672a4ca8335d51b3796730","observation_id":"dc7986d5-c5af-4279-bd62-9dae15108a73","resolution":{"observed_at":"2026-05-22T13:11:35.756580Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:55:24.001934Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17021","last_updated":"2025-05-22T17:59:58Z","snapshot_observed_at":"2026-08-08T11:44:17.973390Z","submitted_at":"2025-05-22T17:59:58Z","title":"ARB: A Comprehensive Arabic Multimodal Reasoning Benchmark","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:55:24.001934Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.17021"},"observation_digest":"sha256:29e04a187eebfb8a5d36aa90e6e6b67ca29ba5887166ca1f11286f016d1cf706","observation_id":"4aa1239c-a36c-4ac4-8feb-489ff15f1a8f","resolution":{"observed_at":"2026-08-07T14:55:24.001934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:51:18.119095Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17399","last_updated":"2025-05-26T11:15:36Z","snapshot_observed_at":"2026-08-09T09:54:37.103525Z","submitted_at":"2025-05-23T02:16:11Z","title":"FullFront: Benchmarking MLLMs Across the Full Front-End Engineering Workflow","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:18.119095Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.17399"},"observation_digest":"sha256:5b9855357a092d0339fc75afdae107b4c50244ddfd2911decd92d60f59dad6e2","observation_id":"917cbe05-127a-47dd-8b36-ba927934ca76","resolution":{"observed_at":"2026-08-07T14:51:18.119095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:51:44.270249Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17423","last_updated":"2026-07-13T15:08:47Z","snapshot_observed_at":"2026-08-10T04:07:34.034332Z","submitted_at":"2025-05-23T03:11:29Z","title":"VIBE: Annotation-Free Video-to-Text Information Bottleneck Evaluation for TL;DR","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:44.270249Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.17423"},"observation_digest":"sha256:900136fac5d66dcea739978a4c4390740292df0c9a084f732bf3c213ad3f3401","observation_id":"822023ef-72e4-4818-a6fb-0a8c6d76f737","resolution":{"observed_at":"2026-08-07T14:51:44.270249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:34:13.827834Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18451","last_updated":"2025-05-24T01:23:02Z","snapshot_observed_at":"2026-08-09T04:52:30.628018Z","submitted_at":"2025-05-24T01:23:02Z","title":"$\\mu$-MoE: Test-Time Pruning as Micro-Grained Mixture-of-Experts","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:13.827834Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.18451"},"observation_digest":"sha256:4c434919ff2a35e3b527c00deac8b12907e900a91f33f16e53f3f10980b8765c","observation_id":"83cd6933-ec06-4df0-b1eb-f65ae61f62c2","resolution":{"observed_at":"2026-08-07T14:34:13.827834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:30:21.584728Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18657","last_updated":"2025-05-24T11:49:31Z","snapshot_observed_at":"2026-08-07T17:10:13.501355Z","submitted_at":"2025-05-24T11:49:31Z","title":"MLLMs are Deeply Affected by Modality Bias","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:21.584728Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.18657"},"observation_digest":"sha256:0a16cb0832520b6f541c40c7afe8aa1eb52730eabcbaa8300e03d2d4e1d7e97c","observation_id":"84836bc0-651d-46b3-8fbf-c737d4b9694f","resolution":{"observed_at":"2026-08-07T14:30:21.584728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:25:41.747798Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18986","last_updated":"2025-05-25T05:44:02Z","snapshot_observed_at":"2026-08-09T06:33:06.067343Z","submitted_at":"2025-05-25T05:44:02Z","title":"VL-SAM-V2: Open-World Object Detection with General and Specific Query Fusion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:41.747798Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.18986"},"observation_digest":"sha256:1d7eebf4b6aed47efee432c4c4b4267d631992511eae1b3ecbf9f886f7586738","observation_id":"33c63cf9-3e2e-4215-ada8-85d55d388162","resolution":{"observed_at":"2026-08-07T14:25:41.747798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:22:23.679059Z","title":"arXiv preprint arXiv:2412.05271 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19195","last_updated":"2025-05-25T15:41:18Z","snapshot_observed_at":"2026-08-10T09:26:28.067411Z","submitted_at":"2025-05-25T15:41:18Z","title":"CardioCoT: Hierarchical Reasoning for Multimodal Survival Analysis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:23.679059Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.19195"},"observation_digest":"sha256:b40ec225e24b7130d006048f9adb874ff10c4783f9bec845b9c4f9ec2b6f3d25","observation_id":"ad2e589f-6bcc-4b8b-8565-678b05f362ab","resolution":{"observed_at":"2026-08-07T14:22:23.679059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:24:42.366000Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19213","last_updated":"2025-05-25T16:20:55Z","snapshot_observed_at":"2026-08-07T20:38:23.317910Z","submitted_at":"2025-05-25T16:20:55Z","title":"Improving Medical Reasoning with Curriculum-Aware Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:24:42.366000Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.19213"},"observation_digest":"sha256:b04bf250212c7d58dd6347714a600af84cca884255f262ba8aa4e1d335144e78","observation_id":"f4f7ae01-793e-4ea3-90f5-516f7ba1e176","resolution":{"observed_at":"2026-08-07T14:24:42.366000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:19:01.977150Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19406","last_updated":"2025-05-26T01:42:38Z","snapshot_observed_at":"2026-08-07T20:32:06.174757Z","submitted_at":"2025-05-26T01:42:38Z","title":"Unveiling the Compositional Ability Gap in Vision-Language Reasoning Model","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:01.977150Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.19406"},"observation_digest":"sha256:73630d2a0d833adfd27042a957f979b5ec6a01e7691166defe5abf90ead30889","observation_id":"f295fbe9-90b6-48b8-ad51-5d90ac34222a","resolution":{"observed_at":"2026-08-07T14:19:01.977150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:16:55.605857Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19509","last_updated":"2025-05-26T04:39:30Z","snapshot_observed_at":"2026-08-09T04:13:10.272902Z","submitted_at":"2025-05-26T04:39:30Z","title":"Benchmarking Multimodal Knowledge Conflict for Large Multimodal Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:55.605857Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.19509"},"observation_digest":"sha256:4e8889c539afa558a03885b0d2939fdef95fec73f0dc4c88898f9bb30a1ee123","observation_id":"3c97a7b7-3b6a-40a8-959d-3a065bd0e19d","resolution":{"observed_at":"2026-08-07T14:16:55.605857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:13:54.408709Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and testtime scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19611","last_updated":"2025-05-26T07:27:18Z","snapshot_observed_at":"2026-08-10T07:36:32.550620Z","submitted_at":"2025-05-26T07:27:18Z","title":"Align and Surpass Human Camouflaged Perception: Visual Refocus Reinforcement Fine-Tuning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:54.408709Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.19611"},"observation_digest":"sha256:781c81e92d3dbc4e6510c46e7508d152da40853852aa3c9f0c0ac64c5cfdf0f1","observation_id":"2699f0e0-d716-4443-96fa-cfcfafcf8b6a","resolution":{"observed_at":"2026-08-07T14:13:54.408709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:13:16.910969Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19684","last_updated":"2025-05-28T15:29:46Z","snapshot_observed_at":"2026-08-10T22:20:46.470959Z","submitted_at":"2025-05-26T08:45:06Z","title":"VisCRA: A Visual Chain Reasoning Attack for Jailbreaking Multimodal Large Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:16.910969Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.19684"},"observation_digest":"sha256:5cfa66c8dfefce774da301d576ecaf4094a561083e550991aa4f8c6983f2f8fa","observation_id":"037a3a34-ad60-4583-98aa-61a6086261d6","resolution":{"observed_at":"2026-08-07T14:13:16.910969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:13:59.949559Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19714","last_updated":"2025-05-26T09:02:35Z","snapshot_observed_at":"2026-08-09T13:26:43.384529Z","submitted_at":"2025-05-26T09:02:35Z","title":"MT$^{3}$: Scaling MLLM-based Text Image Machine Translation via Multi-Task Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:59.949559Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.19714"},"observation_digest":"sha256:7906874edf5cf7f0e7b647ef7b4571441f5fd109b817b4aa0709b4ea0bc88e54","observation_id":"2bf1845f-f9b1-4086-930c-d38c6ee018da","resolution":{"observed_at":"2026-08-07T14:13:59.949559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:08:07.651269Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20100","last_updated":"2025-05-26T15:08:37Z","snapshot_observed_at":"2026-08-10T18:54:11.396770Z","submitted_at":"2025-05-26T15:08:37Z","title":"AdaTP: Attention-Debiased Token Pruning for Video Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:08:07.651269Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.20100"},"observation_digest":"sha256:92e3aeea8d23c03ef66ec766eddc06b71496271e9e4e948a2438afaab5dd5b0f","observation_id":"bc8321d9-4ebe-4ec6-9b16-5f6864a728b2","resolution":{"observed_at":"2026-08-07T14:08:07.651269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T14:02:53.381768Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20256","last_updated":"2025-05-26T17:34:06Z","snapshot_observed_at":"2026-08-09T22:46:03.896690Z","submitted_at":"2025-05-26T17:34:06Z","title":"Omni-R1: Reinforcement Learning for Omnimodal Reasoning via Two-System Collaboration","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:53.381768Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.20256"},"observation_digest":"sha256:f6b0131cc8eca618493d5bd5034fd68f9d0394ab8e67cdb023edc53e6d991041","observation_id":"373e72bc-1f8a-40de-bfaa-f65fa07922f0","resolution":{"observed_at":"2026-08-07T14:02:53.381768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2505.21374","last_updated":"2025-05-27T16:05:01Z","snapshot_observed_at":"2026-08-06T04:32:21.352745Z","submitted_at":"2025-05-27T16:05:01Z","title":"Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-17T05:40:55.944288Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.21374"},"observation_digest":"sha256:54a6311bee48af8fcda899002fe79bec4af0bf8a7789b51990b98416c9406908","observation_id":"bbb13462-b46a-4cf4-9581-2759a67ac555","resolution":{"observed_at":"2026-05-17T05:40:56.057848Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T13:40:17.736081Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21389","last_updated":"2025-05-27T16:17:15Z","snapshot_observed_at":"2026-08-10T17:27:34.890094Z","submitted_at":"2025-05-27T16:17:15Z","title":"AutoJudger: An Agent-Driven Framework for Efficient Benchmarking of MLLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:40:17.736081Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.21389"},"observation_digest":"sha256:5bd9a9b500acfb22f463e27101ef9eaefb8548ae4e68e5f521c86033039517fc","observation_id":"0c8d5d8f-a9db-45a7-b901-2184cca4158c","resolution":{"observed_at":"2026-08-07T13:40:17.736081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T13:33:53.834178Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21465","last_updated":"2025-05-27T17:36:23Z","snapshot_observed_at":"2026-08-07T16:43:25.522882Z","submitted_at":"2025-05-27T17:36:23Z","title":"ID-Align: RoPE-Conscious Position Remapping for Dynamic High-Resolution Adaptation in Vision-Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:53.834178Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.21465"},"observation_digest":"sha256:2dca5840b41d6b70e9835af0375c6885b17372d46c8301ebbac96bec96332523","observation_id":"794782d4-e9a5-40f2-8394-4d03513b5c12","resolution":{"observed_at":"2026-08-07T13:33:53.834178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T13:24:49.709222Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22019","last_updated":"2025-06-03T05:28:55Z","snapshot_observed_at":"2026-08-09T11:28:56.534515Z","submitted_at":"2025-05-28T06:30:51Z","title":"VRAG-RL: Empower Vision-Perception-Based RAG for Visually Rich Information Understanding via Iterative Reasoning with Reinforcement Learning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:24:49.709222Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.22019"},"observation_digest":"sha256:e7ec9f59788c3109dede130e094fd2808d7d7015bbb02abd3bea411718a28e2d","observation_id":"e9790918-9649-4cc5-ab71-331c48752194","resolution":{"observed_at":"2026-08-07T13:24:49.709222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T13:22:21.610900Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22050","last_updated":"2025-07-13T09:27:37Z","snapshot_observed_at":"2026-08-10T22:16:06.046077Z","submitted_at":"2025-05-28T07:21:37Z","title":"Reinforced Reasoning for Embodied Planning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:22:21.610900Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.22050"},"observation_digest":"sha256:4e8c392480dc27909bc673c7918db1be7d42809b896aa4a3ab10099e757f400f","observation_id":"ab1fe195-2f7d-4b5c-bb0e-a44cd8a1818e","resolution":{"observed_at":"2026-08-07T13:22:21.610900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T13:19:04.332212Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22126","last_updated":"2025-05-28T08:51:01Z","snapshot_observed_at":"2026-08-09T20:35:08.450172Z","submitted_at":"2025-05-28T08:51:01Z","title":"SridBench: Benchmark of Scientific Research Illustration Drawing of Image Generation Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:19:04.332212Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.22126"},"observation_digest":"sha256:a9a7f9e0d328c4b2f2c51ef7e25f7a94083a8befd4ff77a4c29618c3327dbf0b","observation_id":"7e203eb4-52f9-4748-a37d-59c946346027","resolution":{"observed_at":"2026-08-07T13:19:04.332212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T13:14:09.473336Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:09.473336Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:2f2338dfacf925326b7c2aa58a378294cbeb8b831bd9cf328d09b05f249c6c39","observation_id":"616cbabc-ee87-4b4a-81fc-493b07965263","resolution":{"observed_at":"2026-08-07T13:14:09.473336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T13:12:05.938818Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test- time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22543","last_updated":"2025-05-28T16:24:52Z","snapshot_observed_at":"2026-08-09T04:20:41.923091Z","submitted_at":"2025-05-28T16:24:52Z","title":"Scaling-up Perceptual Video Quality Assessment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:05.938818Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.22543"},"observation_digest":"sha256:ff5da603280744bf893c0449dcb9a813df01efb1ab043e6f68fb4a4666e96da5","observation_id":"233a67b4-7300-4094-bd33-e442cae16063","resolution":{"observed_at":"2026-08-07T13:12:05.938818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T13:09:26.367593Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-10T20:28:52.024760Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:26.367593Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:6bbc3a9fa613000f2be28ee483d4493b51dbb6fed749b16a2c3cb2b1f8c58fff","observation_id":"c51cfa79-1d7a-46af-bebb-b92b42132eb1","resolution":{"observed_at":"2026-08-07T13:09:26.367593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T12:59:24.706741Z","title":"Expanding per- formance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23008","last_updated":"2025-05-29T02:34:36Z","snapshot_observed_at":"2026-08-07T12:53:13.243609Z","submitted_at":"2025-05-29T02:34:36Z","title":"Synthetic Document Question Answering in Hungarian","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.706741Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.23008"},"observation_digest":"sha256:3eb6e8a8d26f1d2593df8ef5880ba3f454431ea577b769d562047960f8dd7053","observation_id":"50f5e6e4-7b4e-42e3-81e1-9c05c4c47877","resolution":{"observed_at":"2026-08-07T12:59:24.706741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T13:00:57.690899Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23043","last_updated":"2025-05-29T03:40:21Z","snapshot_observed_at":"2026-08-07T12:52:49.331015Z","submitted_at":"2025-05-29T03:40:21Z","title":"Are Unified Vision-Language Models Necessary: Generalization Across Understanding and Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:57.690899Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.23043"},"observation_digest":"sha256:18de13b6e01118d8103cb90cb5229911be5ce60c7f73456cb23fd954dba95c3f","observation_id":"1633aeeb-f418-4f81-ad87-d005d7b4126e","resolution":{"observed_at":"2026-08-07T13:00:57.690899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T12:59:22.902200Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23091","last_updated":"2025-06-23T08:47:25Z","snapshot_observed_at":"2026-08-08T00:05:53.204971Z","submitted_at":"2025-05-29T04:51:56Z","title":"Infi-MMR: Curriculum-based Unlocking Multimodal Reasoning via Phased Reinforcement Learning in Multimodal Small Language Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.902200Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.23091"},"observation_digest":"sha256:8174a1e93d7b6694c97597616938289e3d8e575dca244880bfaa176e3256894f","observation_id":"064d151c-f6d6-48f8-abe0-6684ee452d39","resolution":{"observed_at":"2026-08-07T12:59:22.902200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T12:40:43.917741Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23922","last_updated":"2025-05-29T18:15:07Z","snapshot_observed_at":"2026-08-09T06:58:13.030008Z","submitted_at":"2025-05-29T18:15:07Z","title":"ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:43.917741Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.23922"},"observation_digest":"sha256:22be8625975f5d97c68fa939f7072f645e0bd0e179b2d66f2f0a32c15efae9c3","observation_id":"25d24c42-a878-4a4f-a6eb-056edf6a179e","resolution":{"observed_at":"2026-08-07T12:40:43.917741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T12:37:43.644290Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24164","last_updated":"2025-05-30T03:11:46Z","snapshot_observed_at":"2026-08-09T00:48:58.339159Z","submitted_at":"2025-05-30T03:11:46Z","title":"Mixed-R1: Unified Reward Perspective For Reasoning Capability in Multimodal Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:43.644290Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.24164"},"observation_digest":"sha256:c1a99e1e5872229523f01fddc076e9e0b6e94b909b971902965cb2f9609612c2","observation_id":"82dd815f-cc4c-4aac-a85e-a3dd84af6992","resolution":{"observed_at":"2026-08-07T12:37:43.644290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T12:36:24.031956Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24182","last_updated":"2025-05-30T03:48:59Z","snapshot_observed_at":"2026-08-08T07:49:06.410674Z","submitted_at":"2025-05-30T03:48:59Z","title":"Seeing is Not Reasoning: MVPBench for Graph-based Evaluation of Multi-path Visual Physical CoT","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T12:36:24.031956Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.24182"},"observation_digest":"sha256:32f2e39c55c764bf8e18af9cfeb6d8af27ace4f2b5dbb98332520bfc426c9568","observation_id":"24f747fc-509d-416c-80e3-8e1d9704fa43","resolution":{"observed_at":"2026-08-07T12:36:24.031956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T12:32:50.466205Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test- time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24329","last_updated":"2025-07-31T03:03:18Z","snapshot_observed_at":"2026-08-09T06:10:22.489105Z","submitted_at":"2025-05-30T08:10:18Z","title":"DisTime: Distribution-based Time Representation for Video Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:50.466205Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.24329"},"observation_digest":"sha256:a7a13e1822984ada58e5d9eba172126505d7deacae6aa07d7a691a312b8b52c5","observation_id":"538b5115-2b18-4501-8090-17fa6c5d4c27","resolution":{"observed_at":"2026-08-07T12:32:50.466205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T12:29:17.939296Z","title":"Preprint, arXiv:2412.05271","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24354","last_updated":"2025-05-30T08:46:23Z","snapshot_observed_at":"2026-08-10T10:53:32.208433Z","submitted_at":"2025-05-30T08:46:23Z","title":"Unifying Language Agent Algorithms with Graph-based Orchestration Engine for Reproducible Agent Research","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:17.939296Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.24354"},"observation_digest":"sha256:c652c44fe8638759b824d934bc73a89b551e9211f147d6ca2f62d522536a54d3","observation_id":"87aac395-fd51-415d-992b-53fc65b37f08","resolution":{"observed_at":"2026-08-07T12:29:17.939296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T12:27:31.646610Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24423","last_updated":"2025-05-30T10:02:15Z","snapshot_observed_at":"2026-08-09T21:48:06.786695Z","submitted_at":"2025-05-30T10:02:15Z","title":"MMAFFBen: A Multilingual and Multimodal Affective Analysis Benchmark for Evaluating LLMs and VLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:31.646610Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.24423"},"observation_digest":"sha256:5f0f2e9ff0a7035ec6eec803584fb9a094044b25188a633194404e74a7d682b2","observation_id":"c113cf7c-5adc-4af2-af5c-8140a0ea177c","resolution":{"observed_at":"2026-08-07T12:27:31.646610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T12:27:28.026719Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24441","last_updated":"2025-05-30T10:23:05Z","snapshot_observed_at":"2026-08-10T16:30:38.499649Z","submitted_at":"2025-05-30T10:23:05Z","title":"SORCE: Small Object Retrieval in Complex Environments","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:28.026719Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.24441"},"observation_digest":"sha256:053d373434a6bc7d26f35e88cf112ef8b8236089ecd512c3fc813b244c1691cf","observation_id":"082977d1-44db-463c-a5ba-4a4e62f6ed8b","resolution":{"observed_at":"2026-08-07T12:27:28.026719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T12:16:09.508644Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271 , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:09.508644Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:2602cc2285f29e18d7d6c4d130171008967ef1a17656ba0467848d1fb5b4b9f6","observation_id":"faf511ce-2e13-437b-8378-3041049502fe","resolution":{"observed_at":"2026-08-07T12:16:09.508644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T12:09:03.480920Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00479","last_updated":"2025-05-31T09:10:43Z","snapshot_observed_at":"2026-08-09T06:24:07.358275Z","submitted_at":"2025-05-31T09:10:43Z","title":"EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:09:03.480920Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.00479"},"observation_digest":"sha256:872814bbba34fb667d2bbb248f23b3cca09f9914f6a12d6272747dc98f9aca18","observation_id":"45b1c30d-60b4-4e2d-9249-f678a1b45626","resolution":{"observed_at":"2026-08-07T12:09:03.480920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T12:01:02.994137Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00855","last_updated":"2025-06-01T06:28:36Z","snapshot_observed_at":"2026-08-09T20:43:19.513638Z","submitted_at":"2025-06-01T06:28:36Z","title":"MedBookVQA: A Systematic and Comprehensive Medical Benchmark Derived from Open-Access Book","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:02.994137Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.00855"},"observation_digest":"sha256:2fe2325d95816c5e971f897ebd4855d27762907e44fe976c5e2bd5251d95a5d3","observation_id":"b01b931d-9111-4054-a48e-48d08084632b","resolution":{"observed_at":"2026-08-07T12:01:02.994137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T11:59:06.001743Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:06.001743Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:e75ab4b5bd4caa56cf8267705535a67c1cc424da31a66aff80fdddc825bb8f8d","observation_id":"765a8170-44c3-4b5f-8f69-cb30a2eebca8","resolution":{"observed_at":"2026-08-07T11:59:06.001743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T11:56:34.368716Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01031","last_updated":"2025-06-01T14:21:02Z","snapshot_observed_at":"2026-08-10T01:11:03.912616Z","submitted_at":"2025-06-01T14:21:02Z","title":"NavBench: Probing Multimodal Large Language Models for Embodied Navigation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:56:34.368716Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.01031"},"observation_digest":"sha256:68a382ccce09f7fd6aa0e25d7d0bec0c3acb87b84099b51d58b7e11b0e35504e","observation_id":"c1723077-1fe6-4428-b60f-2d9391758425","resolution":{"observed_at":"2026-08-07T11:56:34.368716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T11:51:14.988403Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01293","last_updated":"2025-06-02T04:00:35Z","snapshot_observed_at":"2026-08-07T17:04:28.844476Z","submitted_at":"2025-06-02T04:00:35Z","title":"Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:14.988403Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.01293"},"observation_digest":"sha256:1b6dcdfe2c9f4e9c160482c449be9f6497efbcc966ba055e7dfb8fbf1b55e827","observation_id":"0e6fe2f7-205c-4d23-bd7a-9b9e7cd2f583","resolution":{"observed_at":"2026-08-07T11:51:14.988403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T11:51:59.500410Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01300","last_updated":"2025-06-02T04:23:21Z","snapshot_observed_at":"2026-08-10T13:34:27.916880Z","submitted_at":"2025-06-02T04:23:21Z","title":"ReAgent-V: A Reward-Driven Multi-Agent Framework for Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:59.500410Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.01300"},"observation_digest":"sha256:accb72740e9e4223cd7444f6c7579300bfa57b3d97eec2a844f72b8eb893613a","observation_id":"b65b9093-4a76-49dc-8d33-1b46a11cc01e","resolution":{"observed_at":"2026-08-07T11:51:59.500410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.05271/citation-record","integrity":"/paper/2412.05271/integrity","json":"/paper/2412.05271/citation-record.json","paper":"/paper/2412.05271"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":"2404.14219","doi":"10.48550/arxiv.2404.14219","metadata_source":"pith","pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","venue":"cs.CL","work_id":"feef9556-a016-493c-abd2-0c97a23a7ebf","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:6a31d62c0ba3fb257511d2ba0798c4f03b6df070b3e47d4008634f06bb1e7e10","observation_id":"f6c45375-722c-4cfa-ac61-f9e4c0d07f36","resolution":{"observed_at":"2026-05-10T20:19:27.408543Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tallyqa: Answering complex counting questions","venue":null,"work_id":"9a69c99e-1f32-4258-a002-37a0798d5c9b","year":2019},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:964553e90469302203274b2867d56794c9a52559b227915de0a222db23386070","observation_id":"354b7464-ff37-4753-ad03-5c415cbf0441","resolution":{"observed_at":"2026-05-10T13:23:58.360590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:2c10bd6fcdde33454b99791fdf0e633a653050f6a89244f5246730db4d19f0f3","observation_id":"93d80056-95b1-492c-94ad-be8acfa3505f","resolution":{"observed_at":"2026-05-10T13:23:58.304469Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wave-ui.https://huggingface.co/datasets/agentsea/wave-ui","venue":null,"work_id":"0a08c2a8-e709-4c17-abdd-f6b5b73841ad","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:9c20d9b055f07c39b319ff5ecc211dc01d68bcd40f36280a1bac115c25a37616","observation_id":"9fba97ac-8164-4ec5-ab38-540fb7d35e16","resolution":{"observed_at":"2026-05-10T13:23:58.363040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"80bfdb3e-04fe-4388-9591-7b8e6f9665a0","year":2022},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:268fa7d41408f3453bcc4ff7b8795f639c5a58fb22149bde1998b9c5c40f01cb","observation_id":"323706d6-fa24-480b-ac17-bda0a7906393","resolution":{"observed_at":"2026-05-10T13:23:58.365608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13319","last_updated":"2019-05-30T21:28:12Z","snapshot_observed_at":"2026-08-10T18:39:13.771066Z","submitted_at":"2019-05-30T21:28:12Z","title":"MathQA: Towards Interpretable Math Word Problem Solving with Operation-Based Formalisms","version":1},"cited_work":{"arxiv_id":"1905.13319","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.13319","snapshot_observed_at":"2026-07-03T23:39:04.460325Z","title":"MathQA: Towards Interpretable Math Word Problem Solving with Operation-Based Formalisms","venue":"cs.CL","work_id":"4539c966-2fd4-4238-88a9-60be171a99da","year":2019},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/1905.13319","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:565b867dfef75c4b591227395fb41ba075261d2b137d57bfa8cccf6bb0521f82","observation_id":"44c6580b-d82f-468d-8fd1-3c31b82425bb","resolution":{"observed_at":"2026-05-10T13:23:57.979866Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CG-bench: Clue-grounded question answering benchmark for long video understanding","venue":null,"work_id":"6eb99437-e900-44d4-a967-bdab9cbcb0a2","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:f95ef82d1f6ad29fa59b842b724e8ab25eebf2e4d5c9f8cab4e6830a35e1c162","observation_id":"e0e95554-2034-4cac-9471-b5bcb336e11c","resolution":{"observed_at":"2026-05-10T13:23:58.368059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":"12617fc3-bc87-4d17-809b-635dc684657c","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:d934aeefaafe21a07866a1218b4df18ffa60745a38fef14efed1c894607b7a9c","observation_id":"46d8af48-b448-47f6-9c96-adc88e7ff32c","resolution":{"observed_at":"2026-05-10T13:23:58.370526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":"2108.07732","doi":"10.1007/s11390-025-5518-5","metadata_source":"pith","pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Program Synthesis with Large Language Models","venue":"cs.PL","work_id":"fd241a05-03b9-4de2-9588-9d77ce176125","year":2021},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:c1b7e615a8890f60ba210af89deb2ed12804db1fc18ed6520bb7d16ad49d421f","observation_id":"d8f74ace-34ed-467e-aa61-059efcbdbd07","resolution":{"observed_at":"2026-05-10T13:23:57.990455Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":"35c0cc65-e610-4126-a39e-6d7043bb4b4b","year":2022},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:7b1436a1d30e6c1ba2a4da7741544486cb98841b9b709a772f3bae424e252953","observation_id":"624abb5d-089f-4e24-be61-b1e657ff8799","resolution":{"observed_at":"2026-05-10T13:23:58.373458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":"1607.06450","doi":"10.1007/978-3-319-32025-0","metadata_source":"pith","pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Layer Normalization","venue":"stat.ML","work_id":"20a2d720-0046-4c7c-bcd6-327ec8143f69","year":2016},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:8992ab054830f1a6a501641ef7bef490cabe92ca9f52856bbc67a8422affe6db","observation_id":"fa35076e-1a37-480f-a103-61cddbd93720","resolution":{"observed_at":"2026-05-10T13:23:58.350691Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.13731","last_updated":"2021-08-10T08:55:21Z","snapshot_observed_at":"2026-08-05T01:53:50.218795Z","submitted_at":"2021-07-29T03:51:36Z","title":"UIBert: Learning Generic Multimodal Representations for UI Understanding","version":2},"cited_work":{"arxiv_id":"2107.13731","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.13731","snapshot_observed_at":"2026-06-28T22:52:44.752192Z","title":"Uibert: Learning generic multimodal representations for ui under- standing","venue":null,"work_id":"e54f651d-7133-40a1-b334-6f98b8e376b1","year":2021},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2107.13731","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:6e689c917f1fe97637b27ae4f0fae58ac5beeaef09eab035f4daa26398e52076","observation_id":"4714b379-b938-4275-8412-a754b91415ce","resolution":{"observed_at":"2026-05-10T13:23:57.822404Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:a52fd69aa7cd974ead371e8204ac0782b88a740b0ca358125744004f3c7bac6c","observation_id":"09e339bd-a6fd-402b-8182-6e3b6b40d1ff","resolution":{"observed_at":"2026-05-10T13:23:57.826373Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beijing Anjie Zhihe Technology Co","venue":null,"work_id":"e6c1cff2-a473-498d-8907-a444dc510587","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:f391730b4d34e4116a1b85346623f02bce8b02bdac145aec020c8de3e316a94f","observation_id":"8e6f0162-5275-409f-b560-26a0c7f33847","resolution":{"observed_at":"2026-05-10T13:23:58.375954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vqa-med: Overview of the medical visual question answering task at imageclef 2019","venue":null,"work_id":"d0e0975a-b2eb-4baa-aa73-a8c98799ed89","year":2019},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:33cd7a631c3da28d6e92fe49e007eda67da83c2524a28c1cc8bf3a8b7766877b","observation_id":"7f6d035e-ec60-4786-9d2c-f490c62ea316","resolution":{"observed_at":"2026-05-10T13:23:58.378510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07159","last_updated":"2020-06-12T13:17:25Z","snapshot_observed_at":"2026-08-11T03:53:10.061881Z","submitted_at":"2020-06-12T13:17:25Z","title":"Are we done with ImageNet?","version":1},"cited_work":{"arxiv_id":"2006.07159","doi":"10.48550/arxiv.2006.07159","metadata_source":"arxiv_reference","pith_arxiv_id":"2006.07159","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are we done with imagenet?arXiv preprint arXiv:2006.07159","venue":"arXiv (Cornell University)","work_id":"9efae043-283b-44ae-8324-207d3747f93f","year":2020},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2006.07159","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:c8405e20bd54eceb9247e44e4a7855aa76a03bd63f4fb25543fbe09c98939c7b","observation_id":"ea95d6a2-7514-4ea7-a452-c8045913625b","resolution":{"observed_at":"2026-05-10T13:23:58.188150Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scene text visual question answering","venue":null,"work_id":"d8a5937c-5598-48c9-b307-598b9d98f2ee","year":2019},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:725fffcf28b7bee618903f08c8d6611769cd2d8b354fe5707d0306bb9aa45206","observation_id":"0bb7bda7-fd34-4aba-becf-74f2a1b0f875","resolution":{"observed_at":"2026-05-10T13:23:58.381204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Coco-stuff: Thing and stuff classes in context","venue":null,"work_id":"ac4600f8-eacf-4a36-a875-b3f3a7361f45","year":2018},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:037528a20d09bca806d01edc9280ea5e5ea7b3535627f30819f344e2b8f9cd6e","observation_id":"7121e350-55b6-465f-8688-93b65c912694","resolution":{"observed_at":"2026-05-10T13:23:58.383753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-02T11:10:24.263044Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":"2403.17297","doi":"10.48550/arxiv.2403.17297","metadata_source":"pith","pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternLM2 Technical Report","venue":"cs.CL","work_id":"dfa13e0e-1c3c-4fb6-943d-a19945bacdbe","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:effd7b03d28937402a46ea3347ece90ee73ac2cfd3d1c090e220ab28a645009d","observation_id":"e101ffbc-5196-4ad1-923a-711163632721","resolution":{"observed_at":"2026-05-15T11:44:38.670888Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An augmented benchmark dataset for geometric question answering through dual parallel text encoding","venue":null,"work_id":"ef844048-4a63-4489-b658-df82681ce03d","year":null},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:39bc53297d20d540c77f268385d05972de39cd17fbf7c957fedddb15d5dac02f","observation_id":"a4363e8f-6050-4b32-8e09-e2d4012c3416","resolution":{"observed_at":"2026-05-10T13:23:58.386224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"openai summarize tldr dataset","venue":null,"work_id":"208fbe8f-fdda-404b-a6c2-60d06a2130ea","year":2023},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:0ba627333bfc6c784e07719a0d0a7f5404b28c554bcf5af36958215239d8e00b","observation_id":"dd3ab7b6-9103-480c-94e6-fa775efba9b0","resolution":{"observed_at":"2026-05-10T13:23:58.388534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17490","last_updated":"2025-05-29T02:43:50Z","snapshot_observed_at":"2026-08-11T03:51:51.000322Z","submitted_at":"2024-07-03T17:59:58Z","title":"AMEX: Android Multi-annotation Expo Dataset for Mobile GUI Agents","version":2},"cited_work":{"arxiv_id":"2407.17490","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.17490","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2407.17490","venue":null,"work_id":"07ffe67e-3e5a-406c-84fe-3de84f8dd21d","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2407.17490","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:385f04e9e4ecfd39bfe9e47684e5470f59a26881ed1ea2efb89a9b4c29f3cb6e","observation_id":"6f6b7ac7-e5ca-4054-b417-548da7b31f1f","resolution":{"observed_at":"2026-05-10T13:23:57.830230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.08545","last_updated":"2022-11-15T22:31:38Z","snapshot_observed_at":"2026-08-09T22:32:24.524992Z","submitted_at":"2022-11-15T22:31:38Z","title":"MapQA: A Dataset for Question Answering on Choropleth Maps","version":1},"cited_work":{"arxiv_id":"2211.08545","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.08545","snapshot_observed_at":"2026-07-02T21:17:24.219845Z","title":"MapQA: A dataset for question answering on choropleth maps","venue":null,"work_id":"6e611921-6f4e-4ace-8a5f-5589c4c99bb9","year":2022},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2211.08545","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:4701a9a1b7d075fa932a2d5e8c0afefe1dda3a91bcd38e0c233e01458102b0c5","observation_id":"fb483837-30a6-4fa4-9425-392ee7ade3e7","resolution":{"observed_at":"2026-05-10T13:23:57.834590Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10819","last_updated":"2025-03-24T11:46:14Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T06:56:53Z","title":"GUI-World: A Video Benchmark and Dataset for Multimodal GUI-oriented Understanding","version":2},"cited_work":{"arxiv_id":"2406.10819","doi":"10.48550/arxiv.2406.10819","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10819","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2406.10819 (2024)","venue":"arXiv (Cornell University)","work_id":"1a0befd0-1bbb-46a3-a6fa-f2876bb1c7fc","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2406.10819","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:417a01a286d11ad158bc6c01e93935fa14d46e45f2b0090d43edc13480573a1b","observation_id":"c53053c5-01e5-4ccf-8047-9d75d2bca10e","resolution":{"observed_at":"2026-05-10T13:23:57.890681Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11684","last_updated":"2024-06-17T07:55:59Z","snapshot_observed_at":"2026-07-06T17:31:53.996417Z","submitted_at":"2024-02-18T19:26:49Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2402.11684","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11684","snapshot_observed_at":"2026-07-10T17:07:25.737454Z","title":"ALLaVA: Harnessing GPT4V-Synthesized Data for Lite Vision-Language Models","venue":"cs.CL","work_id":"4cf5f4e3-c59a-4ccb-a655-563157a9ce74","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2402.11684","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:0fa65311002f902c896767b6862241f8091c113b8b17c752612f0485fc1b9082","observation_id":"60562b2e-a27c-4d56-b8c2-6b73887b1e0f","resolution":{"observed_at":"2026-05-23T22:20:22.000193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.02746","last_updated":"2022-12-06T04:37:51Z","snapshot_observed_at":"2026-08-06T05:59:54.593795Z","submitted_at":"2022-12-06T04:37:51Z","title":"UniGeo: Unifying Geometry Logical Reasoning via Reformulating Mathematical Expression","version":1},"cited_work":{"arxiv_id":"2212.02746","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.02746","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unigeo: Unifying ge- ometry logical reasoning via reformulating mathematical ex- pression","venue":null,"work_id":"af30a6d9-06bd-4f07-8034-9901b48c33d9","year":2022},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2212.02746","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:0cfb76e4996c5fcebce9213af0412701cda6faa3f034a2a2300c85c1fac359ab","observation_id":"659889a3-271d-4631-9648-860b79fec7d1","resolution":{"observed_at":"2026-05-10T13:23:57.903870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":"2306.15195","doi":"10.48550/arxiv.2306.15195","metadata_source":"pith","pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","venue":"cs.CV","work_id":"44525076-312a-4259-b79c-134cd7eeb297","year":2023},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:530d7514aba5c0ad2425bb303491c95802d25478c503385894bcdfa1cd180091","observation_id":"127d7c43-50e8-49af-bbac-9ac9e201ae31","resolution":{"observed_at":"2026-05-12T15:52:36.167809Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":"2403.20330","doi":"10.48550/arxiv.2403.20330","metadata_source":"pith","pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","venue":"cs.CV","work_id":"0d0b977c-a42e-49b1-869e-b7360dca5282","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:e1669de21d1a762d917b6d8b8b6c7a97505ed56b2ad2f9c81bcaf1e32902247c","observation_id":"1f6485f8-3e12-4f5e-97e5-41ac988bff8e","resolution":{"observed_at":"2026-05-12T19:41:44.612219Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.921853+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.921853+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":"2311.12793","doi":"10.48550/arxiv.2311.12793","metadata_source":"pith","pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","venue":"cs.CV","work_id":"90e2b26a-3d27-4567-86b5-929b582a8034","year":2023},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:d0d7a4078475b3fb8d8f74eb8f60b90403986fcb48cdbac43d5a08349f7b9358","observation_id":"f3a0cecc-bea8-4593-a9bb-c07b62f3935f","resolution":{"observed_at":"2026-05-13T17:08:13.182567Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:08.932244+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":"2406.04325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-07-04T06:39:37.677235Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"22138421-9fc7-4d3e-8a5b-90fd9a0a6c97","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:66fc138860a967bc5388c89132cecfe5efd57576d631cd4ae712cc409ce0f191","observation_id":"235ff406-5120-49e3-9bd1-921fedb6817a","resolution":{"observed_at":"2026-05-10T13:23:57.967610Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:cefd230e96aea500c94331224a8916c053b0dd4e580782ec1dc3671b80b5cb83","observation_id":"7993ecb8-ec6e-47c0-b96e-09826a1b3e5c","resolution":{"observed_at":"2026-05-10T13:23:57.971121Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":"cb6ab37f-f9a4-49cb-bb85-3fa1c1158a6d","year":null},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:c0aa840d558a789aa2c7d0e83d9f9890ef0aed1f70d97e9194446fea0288bc36","observation_id":"22fcdd29-2720-4847-99da-eb49e1a98a7b","resolution":{"observed_at":"2026-05-10T13:23:58.391100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Theoremqa: A theorem-driven question answering dataset","venue":null,"work_id":"ea624180-62af-4c29-9aa9-77d78a27166e","year":2023},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:d6ebb2396a3952609706b394e53c712afd0ee00e698c6337a028c2edad7adbbe","observation_id":"ee10c80f-3f0a-4ca0-b821-35c3987f5ae8","resolution":{"observed_at":"2026-05-10T13:23:58.393419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12307","last_updated":"2024-03-08T15:26:38Z","snapshot_observed_at":"2026-08-10T18:05:01.074940Z","submitted_at":"2023-09-21T17:59:11Z","title":"LongLoRA: Efficient Fine-tuning of Long-Context Large Language Models","version":3},"cited_work":{"arxiv_id":"2309.12307","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.12307","snapshot_observed_at":"2026-07-10T04:06:44.659559Z","title":"Longlora: Efficient fine-tuning of long-context large language models","venue":"cs.CL","work_id":"5649158b-b4f0-42fc-a7ce-1e8e12f1ff6d","year":2023},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2309.12307","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:74ac6b3e23f9cde7569bfe295fa820403296b2a0afd68f341cb110cd8ade1047","observation_id":"8e3386e5-9654-44b0-99f9-8f203cd8f7e5","resolution":{"observed_at":"2026-05-10T13:23:57.999994Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":"2404.16821","doi":"10.48550/arxiv.2404.16821","metadata_source":"pith","pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","venue":"cs.CV","work_id":"3714835e-c5a6-4d7e-950c-be44670ed9e6","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:3678e7c2ea2b012435ab0fa0c29b16366672655b991c394033821f896f05b177","observation_id":"3d589368-0d9b-4329-bab3-856bd93828e0","resolution":{"observed_at":"2026-05-12T20:58:59.653229Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"d549a631-618a-4997-9c12-b26c8c1fd159","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:bd0bdcc592b04d21f82b287b911f32dc4e43a5b3cf1085e934c1109565eb1677","observation_id":"32d5ffd0-f0f2-439d-ba2e-b0117d08fd83","resolution":{"observed_at":"2026-05-10T13:23:58.395678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10935","last_updated":"2024-02-23T04:36:51Z","snapshot_observed_at":"2026-08-08T03:28:12.161766Z","submitted_at":"2024-01-17T08:10:35Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","version":2},"cited_work":{"arxiv_id":"2401.10935","doi":"10.48550/arxiv.2401.10935","metadata_source":"pith","pith_arxiv_id":"2401.10935","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","venue":"cs.HC","work_id":"8fe50425-9d6d-4080-bd43-51b3d0d0e5f6","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2401.10935","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:01d8d270169dd79dd20e3dccb7197cf71e4b94d2122c2d223f2d0a614ce12d34","observation_id":"b8a88a99-2a9f-45e9-ab5a-1e92c7b096b4","resolution":{"observed_at":"2026-05-17T10:09:46.778093Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":"2406.07476","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-07-04T16:49:57.279303Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","venue":"cs.CV","work_id":"ccfc3f89-c510-45f1-8a35-ed1a56c0ae5c","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:9289d650c164be5a94f710905412b61e9b6f8e66a7f6925d9b353a35c23e8664","observation_id":"40bb2c53-e9d1-49b9-855f-a2b08239daea","resolution":{"observed_at":"2026-05-11T02:44:53.738794Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.04729","last_updated":"2019-08-28T16:24:53Z","snapshot_observed_at":"2026-08-10T12:14:32.877990Z","submitted_at":"2019-08-13T16:47:08Z","title":"Complicated Table Structure Recognition","version":2},"cited_work":{"arxiv_id":"1908.04729","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1908.04729","snapshot_observed_at":"2026-07-04T06:09:37.420160Z","title":"arXiv:1908.04729 (2019)","venue":null,"work_id":"06513162-d5c8-4c90-a862-889b339725bb","year":2019},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/1908.04729","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:1729dfe10ff1713220c996a56c63be339270e961d184f9b1227cfb06ea93797b","observation_id":"77e3eb98-8e06-4249-a49c-28d457da9b53","resolution":{"observed_at":"2026-05-10T13:23:58.297348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Icdar2019 robust reading challenge on arbitrary-shaped text-rrc-art","venue":null,"work_id":"615b98bc-1149-4e88-ae01-58a7d06949c7","year":2019},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:02f0e43b4cf93d9dd20975dbcf6deb504273f8bc2347297829b33c8bc427957f","observation_id":"2072faca-4cc8-4def-8c17-493f25100f25","resolution":{"observed_at":"2026-05-10T13:23:58.398154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling instruction-finetuned language models.Journal of Machine Learning Research, 25(70):1–53","venue":null,"work_id":"0682bd56-3144-4eb7-b22b-24ba46bc8058","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:f7137b3f65417c8a0573f7a694ef1eaf65966338162f1ef7c066526c98e62769","observation_id":"8442830c-d1a9-448f-9194-58572393f992","resolution":{"observed_at":"2026-05-10T13:23:58.400595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simple and effective multi-paragraph reading comprehension","venue":null,"work_id":"49ca4cea-2247-42c9-b6da-6206c3eb729c","year":2018},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:51df0b0aa46add0538f1be679cf4dc99edc00763d26cf89277f76b58ef1a7bc6","observation_id":"5d768e4e-9c07-435f-8abe-2c3758eae32e","resolution":{"observed_at":"2026-05-10T13:23:58.402827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:87f75072446c440478b6871f128ac4c23dac879dd0ad41a81bf2fee13ea7eda0","observation_id":"44bf3c12-1781-47b2-af9c-6c485ee89c51","resolution":{"observed_at":"2026-05-10T13:23:57.818171Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Free dolly: Introducing the world’s first truly open instruction-tuned llm.Company Blog of Databricks","venue":null,"work_id":"8a89c53c-2623-483b-ad93-81b5a1e5efbb","year":2023},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:f4e84c11795971ddec9d4f32bb98ccd7d7b07db34bc5e81a6341c7e9650fc894","observation_id":"cf974630-4a7d-480c-bae4-e9fdbb75f9d2","resolution":{"observed_at":"2026-05-10T13:23:58.405052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmsegmentation: Openmmlab semantic segmentation toolbox and benchmark","venue":null,"work_id":"48f48d04-5282-4f55-8712-c63a9a405775","year":2020},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:d30a2d7e7f6f39d1e1389464e1adcb353cd80457dd793433d77e751f9149d836","observation_id":"95ba00ff-1a82-44d4-8d0d-2b02e1fddd1a","resolution":{"observed_at":"2026-05-10T13:23:58.407306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Opencompass: A universal evaluation platform for foundation models","venue":null,"work_id":"dc9e64a8-b8ec-44c5-8036-34110a3a1b0f","year":2023},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:82fbf5612e053b5202461268934065031a528e3c4695cb24a11e4b34a078d275","observation_id":"47acdf29-cdb4-4dd7-a7e4-4fa9d700e13e","resolution":{"observed_at":"2026-05-10T13:23:58.409684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grok-1.5 vision preview: Connecting the digital and physical worlds with our first multimodal model","venue":null,"work_id":"9a9471c4-76bd-4b79-a068-ef349b2881db","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:cd7d0de914e907630f96d5393d8943f883e18426c16228aba72fab92c38d2a0b","observation_id":"55afcede-c500-4d5a-831c-724fe53fda83","resolution":{"observed_at":"2026-05-10T13:23:58.412165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-02T07:46:40.319683Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":"2310.01377","doi":"10.1007/s10618-021-00759-3","metadata_source":"pith","pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","venue":"cs.CL","work_id":"5f1e5704-a4ce-482a-b124-b3692397be11","year":2023},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:a59f6d2139fbc74435aacfa282a1c9bf802e8507b5b0d01045c25d2590dc1c57","observation_id":"10522019-f25c-41d5-9fb1-e405a54f695c","resolution":{"observed_at":"2026-05-17T16:41:29.205174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08515","last_updated":"2024-07-12T01:19:33Z","snapshot_observed_at":"2026-08-02T05:39:29.403958Z","submitted_at":"2024-07-11T14:00:14Z","title":"15M Multimodal Facial Image-Text Dataset","version":2},"cited_work":{"arxiv_id":"2407.08515","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.08515","snapshot_observed_at":"2026-07-02T21:17:24.132233Z","title":"15m multimodal facial image-text dataset","venue":null,"work_id":"a391bd78-8a67-4418-9a5d-ab57d9832e05","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2407.08515","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:50254f350970b08ddd15d51d6d1c39d21c34f40dfa44fc00fc08bb6338fba1dc","observation_id":"f3cd8071-a568-4027-827a-498bba347186","resolution":{"observed_at":"2026-05-10T13:23:57.868217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11402","last_updated":"2024-10-22T23:13:34Z","snapshot_observed_at":"2026-07-06T19:17:02.745056Z","submitted_at":"2024-09-17T17:59:06Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2409.11402","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.11402","snapshot_observed_at":"2026-07-02T02:56:29.429018Z","title":"NVLM: Open Frontier-Class Multimodal LLMs","venue":null,"work_id":"05897a70-23cd-425f-b903-02c1293c04a0","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2409.11402","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:f11ceb98c6c8c4e21e30773bd7388a40a824a25080e2d8c38f58c5b2cdd79f0c","observation_id":"e43d73ea-e6e2-4505-95b4-506290f133e8","resolution":{"observed_at":"2026-05-10T13:23:57.872990Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual dialog","venue":null,"work_id":"68562624-c684-4c44-a70d-3a97133de53c","year":2017},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:48bcde56dbb0952ad0fbc5d9deaa050e80f3f9afeda5f6a0afd3edf27941e250","observation_id":"d9215db8-6b1a-4f96-94c6-4b1a1308751d","resolution":{"observed_at":"2026-05-10T13:23:58.414638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep visual template-free form parsing","venue":null,"work_id":"6f5ac278-a287-4420-a264-1206e7351578","year":2019},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:5ae2de22ad38a4b12ceda23c7d97734cf948a8704c9719929521a0d19eff0051","observation_id":"1f38ce5d-6752-4d25-a716-95b6b5740df3","resolution":{"observed_at":"2026-05-10T13:23:58.417043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling vision transformers to 22 billion parameters","venue":null,"work_id":"899219b6-94ca-4970-a5c7-72ddb97a4f04","year":2023},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:93b16f0b47a6f306e59ff09b31ae74f14e7092664499e2f4e19a8ed8133beeb1","observation_id":"5e330b7a-74b4-4e11-bf4b-817f6e0fb2ab","resolution":{"observed_at":"2026-05-10T13:23:58.419210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:fa2470c40176c80daf125b2beb9d55abd8f77e2010d5c6f94cfeae6d58b7c7f2","observation_id":"7286b563-8a32-4138-aa2c-422486401088","resolution":{"observed_at":"2026-05-15T01:55:12.888993Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rico: A mobile app dataset for building data-driven design applications","venue":null,"work_id":"9aa0acf7-80bc-42e5-9c35-0828cc3a9a68","year":2017},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:4f26b378cda15589618afd65dceea5d27f0b25ec1edd21d86cd976f04f77f34b","observation_id":"e83a9c2e-b407-44d3-8d3c-e83bb8c36cc8","resolution":{"observed_at":"2026-05-10T13:23:58.421594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"da935945-0128-45f3-8761-abda67b1e382","year":null},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:cfaf4cf502f29e393750236f870cd8e83fec900ef3a37ebb7c7bb9f4c911a145","observation_id":"d7f5bb5b-eab9-4755-9c7b-5da408ac3dd0","resolution":{"observed_at":"2026-05-10T13:23:58.424129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mind2web: Towards a generalist agent for the web.Advances in Neural Information Processing Systems, 36","venue":null,"work_id":"f5d40edd-7458-4931-b36c-1dcc914bc705","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:ea40376876e3930a0045be1e57eefa1bcafa515212f926fad962615a54f37a41","observation_id":"bed1a26e-b107-425b-8654-6f8d9aaae828","resolution":{"observed_at":"2026-05-10T13:23:58.426651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14233","last_updated":"2023-05-23T16:49:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T16:49:14Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","version":1},"cited_work":{"arxiv_id":"2305.14233","doi":"10.48550/arxiv.2305.14233","metadata_source":"pith","pith_arxiv_id":"2305.14233","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","venue":"cs.CL","work_id":"5b264119-de53-49d1-b7be-d172bf51c834","year":2023},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2305.14233","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:bdf59cf5b78a5d56c1b37b9d0bc3efaa6c95cdd283ed21b6b640599215e9fc37","observation_id":"1fdc4fd8-47a4-4c8e-8316-1f1e03ad236e","resolution":{"observed_at":"2026-05-15T17:25:08.436185Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:27.379194+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:27.379194+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12480","last_updated":"2024-08-23T09:52:52Z","snapshot_observed_at":"2026-08-09T09:33:25.804213Z","submitted_at":"2024-08-22T15:15:51Z","title":"Vintern-1B: An Efficient Multimodal Large Language Model for Vietnamese","version":2},"cited_work":{"arxiv_id":"2408.12480","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.12480","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2408.12480 (2024)","venue":null,"work_id":"dad3d629-0897-4dae-855b-897c7efcde15","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2408.12480","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:6e4d78764e419830cceb2dd374329f5b702c0385386a87e9d92a7c739fd643cf","observation_id":"6310e289-b803-4cb2-b21a-858594f9b6ad","resolution":{"observed_at":"2026-05-10T13:23:57.959889Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06512","last_updated":"2024-04-09T17:59:32Z","snapshot_observed_at":"2026-08-06T19:00:20.787763Z","submitted_at":"2024-04-09T17:59:32Z","title":"InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD","version":1},"cited_work":{"arxiv_id":"2404.06512","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.06512","snapshot_observed_at":"2026-07-04T08:19:44.167431Z","title":"Internlm-xcomposer2-4khd: A pioneer- ing large vision-language model handling resolutions from 336 pixels to 4k hd","venue":null,"work_id":"799b1f12-2edc-4b09-a83b-dbd87e1404e7","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2404.06512","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:c2902872e2465b4f4d413e20d53279a25876ac66ec3c2a40182404c82222818c","observation_id":"caf1b279-98f3-42ab-99e1-0add0841ad00","resolution":{"observed_at":"2026-05-10T13:23:57.963396Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"a10fe701-c19a-49c8-9925-8522ba194960","year":2020},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:7eddedcb82c692c72905f9732fe0b27dd6be2e9fe51f60ee2a785317ddf3f492","observation_id":"9a81c0a4-de17-496c-b52b-09e5ae113c23","resolution":{"observed_at":"2026-05-10T13:23:58.429366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Glm: General language model pretraining with autoregressive blank infilling","venue":null,"work_id":"fac649ec-9213-47b0-95f5-6fd0ebfc9cf5","year":2022},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:63ab09c60d1b24832e2531b28a8121f98a1834569cce7dadeafc0e843e8cf3f7","observation_id":"a2a7b757-325b-4b77-bb96-7764b6a85952","resolution":{"observed_at":"2026-05-10T13:23:58.432075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":"82c3c4fc-3627-452e-8a49-416892dcff52","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:dd1e71ad0fb16aa18e7501982d7724c4d50d3d54272e9fc551f079c43998149c","observation_id":"6dbff460-5d56-49d6-b8d8-fab692dc5b19","resolution":{"observed_at":"2026-05-10T13:23:58.434722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:d915e68768a99e50caa3577c49dd17f45a2f4c51bc7a3f97aacc19344bf15398","observation_id":"3170f94b-7a23-46b3-b90b-751fc514e2d5","resolution":{"observed_at":"2026-05-10T13:23:57.983459Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14515","last_updated":"2024-10-30T13:38:10Z","snapshot_observed_at":"2026-08-10T10:57:30.502675Z","submitted_at":"2024-06-20T17:26:01Z","title":"MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding","version":3},"cited_work":{"arxiv_id":"2406.14515","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14515","snapshot_observed_at":"2026-06-28T23:12:46.636950Z","title":"Mmbench-video: A long-form multi-shot benchmark for holistic video under- standing","venue":null,"work_id":"0108342f-f183-4a3e-930e-337bd83a6601","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2406.14515","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:47675100a2157beac0b68d6dc95b6618d4b85e1363b393e119525ca416385f64","observation_id":"0bbc87ab-4cc4-4e82-851a-e02b4159ce21","resolution":{"observed_at":"2026-05-10T13:23:57.987120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eva: Exploring the limits of masked visual representation learning at scale","venue":null,"work_id":"b121326e-11db-46bd-826c-25a347ec98d6","year":2023},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:e4ff5f94e2750d4ab6924a54a40aa4de4f4e5211ec582ece4d5d688e9ea901d0","observation_id":"66de3b3f-90be-48f2-8765-9a3ed77d7fe2","resolution":{"observed_at":"2026-05-10T13:23:58.437245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finevideo","venue":null,"work_id":"f9ccae64-7aba-45c5-96bd-e729371f7866","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:8fff6b561b7934c4a8f1743ade4fdeb5f9fcebbafd122bf65ec25746faab7204","observation_id":"62238b76-6a20-4a0d-8d56-4e96b07e5dc9","resolution":{"observed_at":"2026-05-10T13:23:58.439617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":"2306.13394","doi":"10.48550/arxiv.2306.13394","metadata_source":"pith","pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-10T13:27:05.561984Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":"cs.CV","work_id":"806d2e73-71b3-4d56-87e0-39d571cc15d6","year":2023},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:865ecfbf0ce1ee5367c99655faa40d915a0a4b2b3b6d1702c40ac05ff4a71bc2","observation_id":"e638a4f1-5d1e-4f00-9214-025ed6f888cc","resolution":{"observed_at":"2026-05-10T20:25:34.870358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.033703+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.033703+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":"2405.21075","doi":"10.1609/icwsm.v17i1.22209","metadata_source":"pith","pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","venue":"cs.CV","work_id":"77fd5ac9-ae98-4846-9d83-e9c73c8f2a52","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:cfcd719a8f9157a4a258a06defc7e7b0089c12b539616166662df32cee836af3","observation_id":"4ba4a556-a5f4-46d4-b39d-05c6a1cae324","resolution":{"observed_at":"2026-05-11T01:58:42.298802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:b7cc65933c33256cf5678095df8f81a221717a1db0875e1f143eedbc272aa3f2","observation_id":"b97e81f7-0bde-406c-b183-6b7e09787a8c","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16261","last_updated":"2024-11-07T15:35:52Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:58:20Z","title":"Mini-InternVL: A Flexible-Transfer Pocket Multimodal Model with 5% Parameters and 90% Performance","version":3},"cited_work":{"arxiv_id":"2410.16261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.16261","snapshot_observed_at":"2026-07-04T10:39:44.698268Z","title":"Mini-internvl: A flexible-transfer pocket multimodal model with 5% parameters and 90% performance","venue":null,"work_id":"7a269605-bab1-4712-a316-89c2d540ebcc","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2410.16261","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:3a409b711659fc8f53a8291f41f02d7f0dd5962ecca00f7f3c7edc4391d1004a","observation_id":"7fedb350-47bb-4f9a-9359-3913c8e6be31","resolution":{"observed_at":"2026-05-10T13:23:58.094306Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Overview of the imageclef 2015 medical classification task","venue":null,"work_id":"6f3b3eb8-cfde-403f-b534-962a1d359172","year":2015},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:0e329e9e5fc9ba0c90116c75277b9a4bd3e7bfd1f17705703aca9a0509ceef7c","observation_id":"5339a34a-c7b7-4878-b74e-45b760824bde","resolution":{"observed_at":"2026-05-10T13:23:58.441847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Glaive code assistant v3 dataset","venue":null,"work_id":"38dd8e55-81f9-4ae5-8ee5-3e9ae31b75a4","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:e8d3866feeb84d961d7006cfd709844621853ad788d8af9dcf4cfaefc240a6ca","observation_id":"fc442fde-599a-4e73-85dc-09b7afc08aa7","resolution":{"observed_at":"2026-05-10T13:23:58.444174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":"60d3700c-95f3-462b-b84b-d01c0094e7fd","year":2017},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:d45bbeff5985c7016ac2fae11456169b8319e52d9821183ec256f0ac8b78cc00","observation_id":"a38aa9de-01fc-437f-a34c-796538a9b56b","resolution":{"observed_at":"2026-05-10T13:23:58.447140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wukong: A 100 million large-scale chinese cross-modal pre-training benchmark.Advances in Neural Information Processing Systems, 35:26418–26431","venue":null,"work_id":"603bf802-1ec9-45db-ba05-33308f15b03e","year":2022},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:e232143d3c726777d522a47ffa4dc030eac55e8e87649576739d28deaf61bbb2","observation_id":"7e44df2f-7b5f-4361-abe4-6e2430872b61","resolution":{"observed_at":"2026-05-10T13:23:58.450331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18558","last_updated":"2025-01-06T12:48:47Z","snapshot_observed_at":"2026-07-06T19:38:57.409491Z","submitted_at":"2024-10-24T09:03:48Z","title":"Infinity-MM: Scaling Multimodal Performance with Large-Scale and High-Quality Instruction Data","version":2},"cited_work":{"arxiv_id":"2410.18558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.18558","snapshot_observed_at":"2026-07-04T09:59:44.997303Z","title":"Infinity-mm: Scaling multimodal performance with large-scale and high-quality instruction data","venue":null,"work_id":"f63b5594-3d56-4965-9657-b11d801dcbe7","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2410.18558","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:5321e1a5904dcb6731ae2d1ef55a222b56fbe3b0219be360f0d8357337fd5342","observation_id":"5fae675e-72b8-49f3-8c13-71fc57915129","resolution":{"observed_at":"2026-05-10T13:23:58.280731Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14566","last_updated":"2024-03-25T06:05:24Z","snapshot_observed_at":"2026-08-02T21:20:28.501823Z","submitted_at":"2023-10-23T04:49:09Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":"2310.14566","doi":"10.48550/arxiv.2310.14566","metadata_source":"pith","pith_arxiv_id":"2310.14566","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","venue":"cs.CV","work_id":"9e143dc0-9074-4760-b9db-ef0ac15dc3cc","year":2023},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2310.14566","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:9cdd6b556d636eb438d7d407eeddc98485e5cdd6027d4c062223b2dce4e9ce48","observation_id":"a3d66bc5-602d-4f6e-833d-809142c9cb8b","resolution":{"observed_at":"2026-05-17T01:22:04.360724Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eaten: Entity-aware attention for single shot visual text extraction","venue":null,"work_id":"8d05bd73-f318-4e6b-b377-28b0c141d333","year":2019},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:d412d6f1c911033c7c807b1eb951a31c34e7a50f127dd49158eeafe544c22a2f","observation_id":"85960aff-c758-4087-be01-70127bcd6fee","resolution":{"observed_at":"2026-05-10T13:23:58.452832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Synthetic data for text localisation in natural images","venue":null,"work_id":"e595ef15-b628-40bc-bacf-85ad9224a90a","year":2016},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:78d03f18eed37f49b4bfc2e5f4ddca9b9abdf85160299840907d95d621d97f9b","observation_id":"67a82fb9-b2d9-4c93-a750-623edba794ac","resolution":{"observed_at":"2026-05-10T13:23:58.455076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":"2402.14008","doi":"10.48550/arxiv.2402.14008","metadata_source":"pith","pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","venue":"cs.CL","work_id":"19abed3b-0ff6-409b-aded-a50205319aa3","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:0eb5bebf832a9d4e4c5d0b7a6218b5d4cc0f64d6a35ea9fe8d67c5bf255bd9a4","observation_id":"699a2106-755f-48b2-9e04-9a632f4f974e","resolution":{"observed_at":"2026-05-11T08:38:21.105975Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10755","last_updated":"2023-09-15T09:52:14Z","snapshot_observed_at":"2026-07-06T16:08:33.160103Z","submitted_at":"2023-08-21T14:40:48Z","title":"WanJuan: A Comprehensive Multimodal Dataset for Advancing English and Chinese Large Models","version":3},"cited_work":{"arxiv_id":"2308.10755","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.10755","snapshot_observed_at":"2026-07-02T22:17:25.674418Z","title":"Wan- juan: A comprehensive multimodal dataset for advancing english and chinese large models","venue":null,"work_id":"9ad40732-9366-4664-8ff4-660de173e5fd","year":2023},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2308.10755","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:bbfa240b3864df9cd581985d2195ee270f90be75bbd4da804105b3003dba8e23","observation_id":"e6bfa9cf-62c2-40fc-91be-52d0081facb4","resolution":{"observed_at":"2026-05-10T13:23:58.347493Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Icpr2018 contest on robust reading for multi-type web images","venue":null,"work_id":"566cdc3c-1f83-4cc1-963c-dfe10e1be8c0","year":2018},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:abca7a5a902733cfd4a700a6c964492a9eb7bd29c97e9662b409bcf9af5d5c00","observation_id":"d0e8539c-9254-4489-90ac-7d2fd41c2461","resolution":{"observed_at":"2026-05-10T13:23:58.457412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.10286","last_updated":"2020-03-07T17:55:41Z","snapshot_observed_at":"2026-07-06T09:06:42.071993Z","submitted_at":"2020-03-07T17:55:41Z","title":"PathVQA: 30000+ Questions for Medical Visual Question Answering","version":1},"cited_work":{"arxiv_id":"2003.10286","doi":null,"metadata_source":"pith","pith_arxiv_id":"2003.10286","snapshot_observed_at":"2026-07-10T18:57:31.568292Z","title":"PathVQA: 30000+ Questions for Medical Visual Question Answering","venue":"cs.CL","work_id":"4e35c15f-5a72-4a89-a773-9d4036871506","year":2020},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2003.10286","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:8306fc9ed60e87120fd70d30b551bca62996eedcc2275dc22baa6b6e5fcbe20f","observation_id":"4bf4431e-000a-445a-8ce5-748ec76f7c19","resolution":{"observed_at":"2026-05-15T05:14:19.084463Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The many faces of robustness: A critical analysis of out-of-distribution generalization","venue":null,"work_id":"885befab-68f8-4800-b645-6cb63dffa56a","year":null},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:fc727db1446158835e893e33ae835f66a3250c4d06aa399a6bc5c83daced199c","observation_id":"a5520a15-8b69-4963-bf98-1098b9fc63d0","resolution":{"observed_at":"2026-05-10T13:23:58.460242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":"f210c582-a096-472c-ad7e-09dd68f613ee","year":null},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:10b4e4c915e294b698008af47559237edc40fe8349631165a580a5398d94128f","observation_id":"b92d0459-6b89-4b34-8e2f-4f09117617e7","resolution":{"observed_at":"2026-05-10T13:23:58.462920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":"97e4226f-e96a-4cfe-941a-73101e612aac","year":2021},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:619d03c99d56f8f5e726651b98d317b33419c92f53fc36ac4ee94e0e7042a996","observation_id":"df2856e6-2c71-4da3-992e-ebb5d925fba4","resolution":{"observed_at":"2026-05-10T13:23:58.465637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Natural adversarial examples","venue":null,"work_id":"e684a7fc-2d40-48f5-b723-862ccfc5a3df","year":2021},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:8552c06dce0cd998572c5009499186361771ba9b2449742f355fce6dff043057","observation_id":"cfd386e3-f8ed-4be4-aef3-019c4f0c951b","resolution":{"observed_at":"2026-05-10T13:23:58.469535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"understanding","venue":null,"work_id":"68943c0f-2f35-482d-8463-5e977c3cedf1","year":2023},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:25642acde664c941ddd2d4276b5749c96abcc41e89a897d09d7e7368f3ea9a98","observation_id":"1866826c-40cb-464d-baf8-ad6367a71bad","resolution":{"observed_at":"2026-05-10T13:23:58.473631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Parsynth-ocr-200k","venue":null,"work_id":"48dc1aa6-ccab-49d8-8ada-e3d171b183bd","year":null},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:e6eddcefdd18d253723d656b33be70c4dc48069df7318ecf79641ddd752fded3","observation_id":"d695a355-98d6-48cb-b35b-c526d39faaae","resolution":{"observed_at":"2026-05-10T13:23:58.475824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09689","last_updated":"2022-12-19T18:21:00Z","snapshot_observed_at":"2026-07-06T14:32:33.541029Z","submitted_at":"2022-12-19T18:21:00Z","title":"Unnatural Instructions: Tuning Language Models with (Almost) No Human Labor","version":1},"cited_work":{"arxiv_id":"2212.09689","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.09689","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unnatural instructions: Tuning language models with (almost) no human labor.arXiv preprint arXiv:2212.09689","venue":null,"work_id":"5f39ecf9-90b2-43a6-afa0-31c49f589257","year":2022},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2212.09689","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:24a759357a25f4ca81ca6d919ab14745c8e531a0e3f9451bc034bb4aa57c832a","observation_id":"9c88df7b-8560-497e-a806-0816a2ed83c7","resolution":{"observed_at":"2026-05-10T13:23:57.839380Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Koniq-10k: An ecologically valid database for deep learning of blind image quality assessment.IEEE Transactions on Image Processing, 29:4041–4056","venue":null,"work_id":"635fab1a-9465-48b3-80de-bad4997f79b1","year":2020},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:08a7aac12dfba5478c1ff8f5aaa2a6a3a2ba64a919f38afc4f1305ebd3858acb","observation_id":"7c2ade04-1f1a-4b33-9f6c-9ddf43dfba83","resolution":{"observed_at":"2026-05-19T00:12:54.670390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.08199","last_updated":"2025-02-09T21:09:17Z","snapshot_observed_at":"2026-08-09T11:44:57.468967Z","submitted_at":"2022-09-16T23:49:00Z","title":"ScreenQA: Large-Scale Question-Answer Pairs over Mobile App Screenshots","version":4},"cited_work":{"arxiv_id":"2209.08199","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2209.08199","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2209.08199 , year=","venue":null,"work_id":"8db0cd8f-f411-4a6d-835a-1182fb74c063","year":2022},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2209.08199","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:631372a543b7a9e8acc11edbdb12f20dba5f21b937fb0c10ecf2ef780349bd0c","observation_id":"f9cda3eb-b097-4f41-814d-e2911563940b","resolution":{"observed_at":"2026-05-10T13:23:57.851045Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12895","last_updated":"2024-03-19T16:48:40Z","snapshot_observed_at":"2026-08-07T02:52:27.054968Z","submitted_at":"2024-03-19T16:48:40Z","title":"mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding","version":1},"cited_work":{"arxiv_id":"2403.12895","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.12895","snapshot_observed_at":"2026-07-10T17:07:25.743722Z","title":"arXiv preprint (2024) DOI: 10.48550/ arXiv.2403.12895","venue":"cs.CV","work_id":"89b0a3a7-ff7a-49bf-af40-a8cf7ee77b16","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2403.12895","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:e3c79c2a60808a0e8334a29b84250ba898de71ca72cefaa44fba640534bcdfa3","observation_id":"36eb7878-7b97-440b-86f7-8d44812fc120","resolution":{"observed_at":"2026-05-10T13:23:57.855416Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Medical-diff-vqa: a large-scale medical dataset for difference visual question answering on chest x-ray images.PhysioNet","venue":null,"work_id":"a43b3c45-1ce4-4975-a2ae-8f9650fe7ffd","year":2023},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:a3d4d960bfafeda98a0966ac4c612f8c9ffd8bb38560b41d53a7aeb24cdc635b","observation_id":"15dd39bf-a818-44c5-916a-6b13c7ab6f3c","resolution":{"observed_at":"2026-05-19T00:12:54.736851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Movienet: A holistic dataset for movie understanding","venue":null,"work_id":"55c9c6ea-dccc-407f-86c5-6dcc092a53a2","year":2020},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:a4cf0af3dc1d609c861e711625155cbc82a623b4189a64bd28eb8dba216aaf8f","observation_id":"6f964294-f194-4733-88d5-be647956b2a8","resolution":{"observed_at":"2026-05-19T00:12:54.824691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"C-eval: A multi-level multi-discipline chinese evaluation suite for foundation models","venue":null,"work_id":"da99eff6-c7e7-4e50-9a22-c3a5759b2581","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:80cf73ad33ddb6a3a5d392dcc76b2bdc8aaf74a3e717ac1c5af0eb9fc52f0386","observation_id":"2f3cc5e8-6445-4223-bfea-2f528fcd8dd9","resolution":{"observed_at":"2026-05-19T00:12:54.801783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Icdar2019 competition on scanned receipt ocr and information extraction","venue":null,"work_id":"3b1866a1-2ccc-43da-9c98-e4c9b434eb1e","year":2019},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:28414fe47b087f72a9f36769cb17f8eeae5c5696ddfebd0fe9d74312f531ee5d","observation_id":"21468330-e7e7-4cca-9bb7-6c2f79fa3cef","resolution":{"observed_at":"2026-05-19T00:12:54.615637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"40850247-f2ee-4112-abbf-528d071c44c3","year":2019},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:a0da21161770cee5203ccf87e683d3f9c00f6c2985cbce4464bf2511a0fafad9","observation_id":"cab861df-f609-4b41-9152-7f9c9c61b937","resolution":{"observed_at":"2026-05-19T00:12:54.516591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Egotaskqa: Understanding human tasks in egocentric videos.Advances in Neural Information Processing Systems, 35:3343–3360","venue":null,"work_id":"a75b830b-9ad4-4ba8-b566-8ed6309f0166","year":2022},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:0ebb3caebf9b4a05edb93de037fec0236029bc097501dc66b78a512bf882d592","observation_id":"6ef5c445-9ec3-44d0-bcea-6883d0311021","resolution":{"observed_at":"2026-05-19T00:12:54.666807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":"2405.01483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-07-04T20:40:07.542575Z","title":"Ku, Qian Liu, and Wenhu Chen","venue":null,"work_id":"ca7dd196-dc3e-4e3c-af1e-c0b02fc0efed","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:bbbb724183da74229a42ba4cd2f57150f0a840edc754a80317f756ea93a48d4f","observation_id":"d3cb90da-ce14-4dc8-937c-e425142bc3da","resolution":{"observed_at":"2026-05-10T13:23:57.921274Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","latest_version":5,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":46,"verified_fuzzy":53},"total_outbound_references":300},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 100 of 300 outbound references and 100 inbound Pith citation observations for arXiv:2412.05271."}