{"as_of":"2026-08-08T11:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ca7fdfcc2756d6209731f86eae83d528a5c2ff6f9f0c65f7c7954ae970569ecc","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:41:03.076855Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:14:03.671614Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-09T05:55:31.163509Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24120","snapshot_observed_at":"2026-08-06T19:14:03.671614Z","title":"Csvqa: A chinese multimodal benchmark for evaluating stem reasoning capabilities of vlms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06167","last_updated":"2025-07-10T15:41:04Z","snapshot_observed_at":"2026-08-07T10:37:03.707334Z","submitted_at":"2025-07-08T16:47:16Z","title":"Skywork-R1V3 Technical Report","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T19:14:03.671614Z"},"links":{"cited_paper":"/paper/2505.24120","citing_paper":"/paper/2507.06167"},"observation_digest":"sha256:189d8f70cd196535ca0484616531a391595b47f5212588d0fe09f4a283c25cdc","observation_id":"135949bd-3881-4ccf-9c25-8f809311f889","resolution":{"observed_at":"2026-08-06T19:14:03.671614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"cited_work":{"arxiv_id":"2505.24120","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24120","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Csvqa: A chinese multimodal benchmark for evaluating stem reasoning capabilities of vlms","venue":null,"work_id":"02416d8a-256a-4cfe-a0c0-fa6915a0b13b","year":2025},"citing_paper":{"arxiv_id":"2605.02378","last_updated":"2026-05-04T09:18:19Z","snapshot_observed_at":"2026-07-06T23:15:27.816549Z","submitted_at":"2026-05-04T09:18:19Z","title":"Enhancing Multimodal In-Context Learning via Inductive-Deductive Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T19:21:30.235583Z"},"links":{"cited_paper":"/paper/2505.24120","citing_paper":"/paper/2605.02378"},"observation_digest":"sha256:ef2c29ac3785a021f8a0f9f7bb61e700369a5449bf63a2a8edd4834e5bd0e8d8","observation_id":"429530aa-4830-4ffc-a5c8-fdadb6c92953","resolution":{"observed_at":"2026-05-09T05:55:31.166191Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24120/citation-record","integrity":"/paper/2505.24120/integrity","json":"/paper/2505.24120/citation-record.json","paper":"/paper/2505.24120"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:40:59.070452Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:59.070452Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:9c74af5c5838a5bc24461e5f7ededffcc87870d7e0fd3acaf94d8f080470b28f","observation_id":"a7584910-2c37-4e9a-b185-661879891cde","resolution":{"observed_at":"2026-08-07T12:40:59.070452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:09.765133Z","title":"Llama 2: Open foundation and fine-tuned chat models, 2023","venue":null,"work_id":"21d9e59a-a90f-4933-8aa7-2f209705e162","year":2023},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:59.118262Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:c71ee8f65f6b79629842c2684aedac427c20887b45f4b20dc5c793c74bf6bed8","observation_id":"c7f311c7-8fad-4b1b-8402-395389ae472a","resolution":{"observed_at":"2026-08-07T12:41:09.813861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:09.652272Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":"4b94f710-c0a7-4f63-abaf-a9c020df5c4b","year":2025},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:59.202715Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:f8824d8bde3258a4e0c9e86fd252f4e557d59fc08a973d049e4c30c65ce12a14","observation_id":"89ecddcb-d994-480e-8a5b-2eabb2e6abc4","resolution":{"observed_at":"2026-08-07T12:41:09.703189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T12:40:59.273403Z","title":"Qwen2-vl: Enhancing vision- language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:59.273403Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:33e4f5d997a2b2a29ca784e8d39819d6ec174de2f474579a05fed4268bfc81f4","observation_id":"94fc0825-f2b2-4750-b2e2-1a5f9fdb828f","resolution":{"observed_at":"2026-08-07T12:40:59.273403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-07T12:40:59.348853Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks.arXiv preprint arXiv:2312.14238, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:59.348853Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:aaf7ca14adb7c639985fede3ef3ac2d869fc280d0d29e252c18c34d56a209dc3","observation_id":"30fdd865-079d-4720-a636-45aff8245f09","resolution":{"observed_at":"2026-08-07T12:40:59.348853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:09.512432Z","title":"Kimi k1.5: Scaling reinforcement learning with llms, 2025","venue":null,"work_id":"b4643a6f-e331-47a6-af54-3f18b4248810","year":2025},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:59.418298Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:ee1b8722785d383aaf34a493d7fca324dad795a44f46dde98737fd420b862a42","observation_id":"c7d9aefb-fa90-4664-b2b6-5d030929f230","resolution":{"observed_at":"2026-08-07T12:41:09.582667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:09.372942Z","title":"Gemini: A family of highly capable multimodal models, 2024","venue":null,"work_id":"13b99ca3-f51f-4a2a-8cca-7f4826117187","year":2024},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:59.496657Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:84d257bb61310d4e79ef67c01f077fa3dec3f0169cd1c5b629c8f6590ca45eeb","observation_id":"161e185d-2897-4d8b-a607-9c89c2732e88","resolution":{"observed_at":"2026-08-07T12:41:09.441409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:09.233483Z","title":"Hello gpt-4o, 2024","venue":null,"work_id":"57c537ec-b3b3-476c-918e-739714c3f491","year":2024},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:59.588916Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:85979df55a647c2ba60291a35b8c9c0df5834b6784ed105c1d6f5a00f5bf7f1b","observation_id":"324b1f69-6911-4cc9-b3fa-04e331ba0a3d","resolution":{"observed_at":"2026-08-07T12:41:09.301657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:09.105773Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling, 2025","venue":null,"work_id":"b239221f-f072-415f-91de-072252c7671d","year":2025},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:59.657293Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:a81038106134e106d47bf102ec0488947de0ebc7e81f46d3002bd12b1bd15d8c","observation_id":"4b54aee7-b2fb-4eac-b9a5-a85a64adee3d","resolution":{"observed_at":"2026-08-07T12:41:09.154599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:08.959379Z","title":null,"venue":null,"work_id":"59290041-b083-4caa-8b5a-0ccfd613e19b","year":2021},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:59.737185Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:ea0e9ffef2d1a5a3f2e04361d6db22efd03de6eb14ff38d54f0b76cb9282e47c","observation_id":"3b68a956-1007-41cf-af05-323095274103","resolution":{"observed_at":"2026-08-07T12:41:09.028912Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:08.808141Z","title":"V Jawahar","venue":null,"work_id":"e9aa0384-74fb-445e-bc6f-7120a5af446a","year":2021},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:40:59.885061Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:41d4ca09e10c80439402a4363012ec52944761decf6475e1c6cab666b76af512","observation_id":"691bd1e8-04a8-46f7-b709-c11d53c7ca57","resolution":{"observed_at":"2026-08-07T12:41:08.888367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:08.664962Z","title":"Mmbench: Is your multi-modal model an all-around player?, 2024","venue":null,"work_id":"b7b00275-b931-4f66-8f26-4913aebd3f74","year":2024},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:00.011399Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:4b4f4fd32d12cb6f0d8e2b4bd53ca90b7b0b627f6724a588c8a284a96dcf6c1d","observation_id":"5ab11a5d-6aa8-4048-8acc-13bb2133af01","resolution":{"observed_at":"2026-08-07T12:41:08.731263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:08.514776Z","title":"Lxmert: Learning cross-modality encoder representations from transformers, 2019","venue":null,"work_id":"3930c5eb-ec32-4ab2-9223-f9300987598b","year":2019},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:00.089071Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:7ca05ab8df3c1c66a83c476a5da20fe585292b019b03ec320a59b49f0b81ac85","observation_id":"3c39f7e8-b013-4221-8c2f-f992ec631666","resolution":{"observed_at":"2026-08-07T12:41:08.599235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:08.367305Z","title":"Uniter: Universal image-text representation learning, 2020","venue":null,"work_id":"da806789-e856-43e6-b844-a56639e92370","year":2020},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:00.145387Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:3689f2586617b62fecc02aeb7cada6ca05f114422575adc2c66af9675e708c85","observation_id":"e6834180-8224-4b54-951f-a16af1736e98","resolution":{"observed_at":"2026-08-07T12:41:08.441957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:00.211295Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:00.211295Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:4fbff92b787652729728a46dfd097c42300ca08774cbc30fe7d759d09c7fe5bf","observation_id":"edf10535-f2d9-4a8d-af74-9a019feafb9a","resolution":{"observed_at":"2026-08-07T12:41:00.211295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:08.202285Z","title":"Le, Yunhsuan Sung, Zhen Li, and Tom Duerig","venue":null,"work_id":"1701cbb5-66c6-4a22-a91b-c0df5312d1a5","year":2021},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:00.304151Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:148d1801496e08e4eed5f4fbd1c5512727e8bc4e81ea4bf8d5eee10ab79bb300","observation_id":"e307d979-e9d1-4bfc-a8de-6c5589e7d12e","resolution":{"observed_at":"2026-08-07T12:41:08.262751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:07.963567Z","title":"Evev2: Improved baselines for encoder-free vision-language models, 2025","venue":null,"work_id":"72a92b0a-aa5a-473e-864d-7b92153276a8","year":2025},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:00.398803Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:60fc4b95bfc9c76d8e0b54df1b3364cdb3aba9a5fae0b97fbbef71de122f9e3e","observation_id":"0165464b-00b6-4e8e-a48f-96a31ff68147","resolution":{"observed_at":"2026-08-07T12:41:08.072117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:07.801138Z","title":"Mono-internvl: Pushing the boundaries of monolithic multimodal large language models with endogenous visual pre-training, 2025","venue":null,"work_id":"be85d071-3eaf-4b26-a9e9-a9b0aed2195c","year":2025},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:00.520998Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:ea4b6b2607bca0d5f9d5eb1070084624093a5c8d3dc7be5273e7612c7bd8542a","observation_id":"e2ff3864-8d3d-4561-aa19-d46c5f3a310c","resolution":{"observed_at":"2026-08-07T12:41:07.866112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:07.664863Z","title":"Introducing Gemini 2.0: Our New AI Model for the Agentic Era","venue":null,"work_id":"26cff343-1964-40e1-81ae-4ad1913a6e7c","year":2024},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:00.644759Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:2ecedaf4c4989643751525aa52e15f401be67257a7a4f0c83e4ed14a9c04fc64","observation_id":"95b64913-819f-4659-ad65-d74794211a08","resolution":{"observed_at":"2026-08-07T12:41:07.721855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:07.514401Z","title":"Gpt-4o system card, 2024","venue":null,"work_id":"9953ff0b-aeb0-493a-85b4-63b426b86540","year":2024},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:00.733515Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:6c857bd30a99522d4ee7699d5d4ad1af22041eed5122516e49739b702fdd281f","observation_id":"bdf30c32-9d80-4129-8d5f-a9364fd3e3b0","resolution":{"observed_at":"2026-08-07T12:41:07.594072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:07.339267Z","title":"A diagram is worth a dozen images, 2016","venue":null,"work_id":"b0a6c732-866e-4980-9f5c-aee4c367cc15","year":2016},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:00.823620Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:145dff79dac574a10191501308ed5a990ab5e53878d9e6798908da87ce36d0bc","observation_id":"ab5f2dc8-7eb7-4aff-80dd-9076505a8771","resolution":{"observed_at":"2026-08-07T12:41:07.426138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:07.138076Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":"bc403341-a01b-4bb3-8c58-94fad7f2558d","year":2019},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:00.934581Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:3bbbf65c27044af616cc2ee1d4d52a7251494aecc5a43ba9edc7b82024b4ca28","observation_id":"d901f0a3-432b-4f3b-aebf-19d4b261882e","resolution":{"observed_at":"2026-08-07T12:41:07.206904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:06.984988Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge, 2019","venue":null,"work_id":"3e454fc9-bba4-425c-a2f1-e0aa858f3979","year":2019},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:01.029385Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:233b0dd74899652f498d078022dc293f0483c649c04d0828a997df3293a29016","observation_id":"3f998ecc-864c-4531-a960-a465f0fd37ed","resolution":{"observed_at":"2026-08-07T12:41:07.060454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:06.847644Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering, 2022","venue":null,"work_id":"bef36cdc-e570-41c0-a350-2ec2d7451b33","year":2022},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:01.115297Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:f0cf8fb3bef4396c02e1dac7dc4392ddd2b169e88ad5360a62162e70d93a1fe0","observation_id":"08c6473d-8e3c-4986-b1da-3893616464c5","resolution":{"observed_at":"2026-08-07T12:41:06.897367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:06.687490Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi, 2024","venue":null,"work_id":"cc155905-5a01-4e04-8411-4746e51d7175","year":2024},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:01.212066Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:378f62deb71594c64f0ac9bbf126903111c99b056e8a3f1b84e6baead5b5ce33","observation_id":"bf849b6d-5d5e-4054-a099-03bda40f6d56","resolution":{"observed_at":"2026-08-07T12:41:06.764386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-07T17:40:59.052312Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-07T12:41:01.334554Z","title":"Can mllms reason in multimodality? emma: An enhanced multimodal reasoning benchmark.arXiv preprint arXiv:2501.05444, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:01.334554Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:bb4c0de273d769994fb739fd5880a7ccc5713e0e97aeec720fc3d358ed5013fd","observation_id":"df31dd7b-4de3-468f-8f15-7c3087c86cca","resolution":{"observed_at":"2026-08-07T12:41:01.334554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:06.547998Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts, 2024","venue":null,"work_id":"af767149-df20-4eae-8f80-9e23038495ca","year":2024},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:01.400126Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:4fd5ed5e7c55ea370d5f72cac576699d05b3e1c5f9be838d379c31e485a7eccb","observation_id":"7df63926-5e1e-41ba-b9f6-9a9c46e755e6","resolution":{"observed_at":"2026-08-07T12:41:06.610441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:06.403625Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset, 2024","venue":null,"work_id":"f8522ce3-1662-4b2e-a5c3-576d378cb20d","year":2024},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:01.467755Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:072c542fbb73078e601432f8a93c66d858ef71ac3a9d4ba069a44854df2be3c4","observation_id":"68aa9c35-5de9-4e43-9aee-38970d0c5ab7","resolution":{"observed_at":"2026-08-07T12:41:06.468702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:06.263494Z","title":"Claude-3.7, 2025","venue":null,"work_id":"906301df-b726-428f-8354-ddde41363364","year":2025},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:01.540750Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:1dac9096d32964e54cc5281e0da413b007009d9cff6953c3d557d6749390e0f3","observation_id":"6b2e37e9-dc90-4229-b1fd-7aba4120cf33","resolution":{"observed_at":"2026-08-07T12:41:06.326033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:06.103356Z","title":"Qwen2.5 technical report, 2025","venue":null,"work_id":"56b96389-bec8-4be8-ae56-090e88b26d59","year":2025},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:01.641120Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:a074895a3f3aa0fe4cc692710cc8b8aab2a8c8d17dd53d6ae7078bec2cf873ea","observation_id":"510321dc-36d3-4e2a-9f78-94bb6aa88056","resolution":{"observed_at":"2026-08-07T12:41:06.178864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:05.951119Z","title":"Mineru: An open-source solution for precise document content extraction, 2024","venue":null,"work_id":"66e5a6cb-9821-4039-90f5-a175724daf05","year":2024},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:01.733700Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:134f6c743a679c5b905782b7bf5120d7a0388827efe6d925394d28d242eefe1a","observation_id":"170d1a4f-c702-4868-bd5f-03b805dbf84e","resolution":{"observed_at":"2026-08-07T12:41:06.014990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:05.789969Z","title":"Deepseek-v3 technical report","venue":null,"work_id":"f11bd128-e26d-4776-b0b5-de8f93d4e115","year":null},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:01.833051Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:20b53538bb8a92fcaeaac9ba6764c1ca24fe0404235e217c489f7495ceba5ee8","observation_id":"4c60abfe-3b64-409d-8ce5-e5c6e6f7704e","resolution":{"observed_at":"2026-08-07T12:41:05.843258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:05.605114Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"5c3228bb-e52b-4424-9227-e43fbadf6601","year":2023},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:01.909165Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:f8f176da1e28502ebfd79de4dc71c28841c76a543f3766d256f20c620531e29e","observation_id":"fef5838e-27b0-4f96-a1fc-0e97b6ef2156","resolution":{"observed_at":"2026-08-07T12:41:05.706057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:05.352084Z","title":"Introducing our multimodal models, 2023","venue":null,"work_id":"49b50a8d-dd06-4498-bab8-ffb55a9505ae","year":2023},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:01.994475Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:1994e1093423619429de932a8edcbb493ecb3c8d0c53090f2648d32f3b0c26c8","observation_id":"85c4e7d7-c828-42a9-822b-530d57871178","resolution":{"observed_at":"2026-08-07T12:41:05.449469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:05.168415Z","title":"Phi-4-mini technical report: Compact yet powerful multimodal language models via mixture-of-loras","venue":null,"work_id":"c23c0e1b-4172-4005-981c-89f527145276","year":null},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:02.078331Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:59a1c744a2eee7e1b7afd1344cc1919700850a1f38f125e4f7d10bf2b2a1d10b","observation_id":"b1515deb-5dbb-41e9-aa5b-4c50b36a65f6","resolution":{"observed_at":"2026-08-07T12:41:05.254171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:02.241977Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:02.241977Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:e6ca4782cad797798080f552f3595c54f057c3db441ae86008c68571a956274a","observation_id":"288caf5c-3887-43dc-a5c0-798a40f0870f","resolution":{"observed_at":"2026-08-07T12:41:02.241977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:05.002873Z","title":null,"venue":null,"work_id":"c77fd29d-771a-4799-b5d8-eff903e27be3","year":2025},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:02.315018Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:c9f8708118fe1a3a739d8b678c9a6b01b604bd79005b91909a981ccd8606ab0d","observation_id":"132f83f7-0961-4137-8bbb-9dbd4ccda514","resolution":{"observed_at":"2026-08-07T12:41:05.072111Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:04.847437Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models, 2025","venue":null,"work_id":"e56de388-5476-448b-88f6-592a8545457e","year":2025},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:02.379786Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:b3300b29f4064f6ed61d8c13fb308852f48916820b814087963f85241d0a8042","observation_id":"e3752dbd-0ef9-45a2-9bbd-02c598537319","resolution":{"observed_at":"2026-08-07T12:41:04.921260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:04.645448Z","title":"Building and better understanding vision-language models: insights and future directions, 2024","venue":null,"work_id":"de1ee567-bc5c-497c-bb0a-1d03ce9839f8","year":2024},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:02.482049Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:a7bb7c7208a8f5cfe7cfb390fb1b51402bd2008e59eda1b5d329d9344310311e","observation_id":"0533e597-c71e-438c-af5f-70a61bf93df6","resolution":{"observed_at":"2026-08-07T12:41:04.758949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:04.414395Z","title":"Improved baselines with visual instruction tuning, 2024","venue":null,"work_id":"226fbdf6-3051-43ce-a79a-981f6460b78e","year":2024},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:02.594606Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:c9273863c7c85210c9095d0d63ad7aa4645699e109115c092aeb5718ed9c3da9","observation_id":"dba9b979-683c-4a3f-baa4-df085e00bf06","resolution":{"observed_at":"2026-08-07T12:41:04.535501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:04.179955Z","title":null,"venue":null,"work_id":"1da9eed2-69a2-4de4-904e-b5f5c489f370","year":2024},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:02.668534Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:319a903db039e0af367312d9b6a74ccc6cff0c7bbc8337edb2ccb9105c099621","observation_id":"34071225-9ce5-4881-8e4e-cdaae9a96577","resolution":{"observed_at":"2026-08-07T12:41:04.279722Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:03.996870Z","title":"Qvq: To see the world with wisdom, December 2024","venue":null,"work_id":"1e1d724d-d1d0-4ba2-8507-5b55993c918e","year":2024},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:02.742793Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:9441dba92e4a85f8b6c40c20a23137839764cb969fa836182606f720f767de1a","observation_id":"f8920688-1ab2-4d0b-a3c3-4934be1addb0","resolution":{"observed_at":"2026-08-07T12:41:04.124055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:03.764697Z","title":"So the final answer is \\boxed","venue":null,"work_id":"0b2b0596-15ba-434b-a0df-eedb32b46142","year":null},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:02.858561Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:5016cc9f83bfb811c0510dd07c72e368c0015db8344927f125226f6bcbe1df70","observation_id":"eb4b8d66-110c-4d78-81af-ba890d089ee8","resolution":{"observed_at":"2026-08-07T12:41:03.865748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:03.537882Z","title":null,"venue":null,"work_id":"d4512d92-d51e-49f0-afc7-e9571e8868d7","year":null},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:02.974741Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:a73b2e40d3d701eb2172ea6956b6ea6ef2839f9ebf0ed3e065b0b1fbdae5bff9","observation_id":"1724ab91-8c2a-4e98-b23e-3b69f20ed704","resolution":{"observed_at":"2026-08-07T12:41:03.646708Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:41:03.271903Z","title":"No,\" please identify the main unreasonable aspects or obvious flaws in the solution; if","venue":null,"work_id":"efc4d3b6-c847-45db-af82-327071c05ea5","year":null},"citing_paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:03.076855Z"},"links":{"citing_paper":"/paper/2505.24120"},"observation_digest":"sha256:7b45ca39d8e97efe48edb467bceab04c6599169a42927f41867c23d80a1bd178","observation_id":"8fd73f73-ea3a-4c2e-8e8b-760cf06a0ba5","resolution":{"observed_at":"2026-08-07T12:41:03.400314Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24120","last_updated":"2025-06-17T01:56:01Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T12:31:51.195385Z","submitted_at":"2025-05-30T01:34:25Z","title":"CSVQA: A Chinese Multimodal Benchmark for Evaluating STEM Reasoning Capabilities of VLMs"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 2 inbound Pith citation observations for arXiv:2505.24120."}