{"as_of":"2026-08-07T22:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c29930dcfeeab0c377b32ee0d690179a06f58ba46f41c71569a87f9a8062f2f0","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:13:26.851065Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T18:31:15.525331Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T00:25:52.598353Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-07T05:46:33.320474Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"cited_work":{"arxiv_id":"2507.06183","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06183","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"697de7fb-db93-4c0f-a1df-85f2fd21d294","year":2025},"citing_paper":{"arxiv_id":"2604.05557","last_updated":"2026-04-07T07:58:55Z","snapshot_observed_at":"2026-07-06T22:54:16.913706Z","submitted_at":"2026-04-07T07:58:55Z","title":"EpiBench: Benchmarking Multi-turn Research Workflows for Multimodal Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T18:31:15.525331Z"},"links":{"cited_paper":"/paper/2507.06183","citing_paper":"/paper/2604.05557"},"observation_digest":"sha256:172c6c29c204aa7c190fd0356572c253fa82b40d19462c8a795b10d5e6acd7e7","observation_id":"c81f5110-650b-476d-88aa-b2734b237dd2","resolution":{"observed_at":"2026-05-11T00:25:52.617911Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.06183/citation-record","integrity":"/paper/2507.06183/integrity","json":"/paper/2507.06183/citation-record.json","paper":"/paper/2507.06183"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T19:13:24.132881Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-07T05:46:33.320474Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:24.132881Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:003347a907201472d6ad510e24ebf075edd20b38a776267d462326267386ef6b","observation_id":"6da5d4b8-7592-4a38-9053-b9b525308c80","resolution":{"observed_at":"2026-08-06T19:13:24.132881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:13:27.781518Z","title":null,"venue":null,"work_id":"99a005c4-0c57-42c3-a72a-cfd60e9bc483","year":2025},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-07T05:46:33.320474Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:24.213162Z"},"links":{"citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:9a23a3dc8ade589fcddf1e07aee5cf71f0eabb875b960bbc7eeadd20a99716d5","observation_id":"5d27ca47-af39-4d2e-8e17-8919808a8380","resolution":{"observed_at":"2026-08-06T19:13:27.873009Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12596","last_updated":"2024-03-19T10:03:07Z","snapshot_observed_at":"2026-08-05T02:21:19.684454Z","submitted_at":"2024-03-19T10:03:07Z","title":"Chart-based Reasoning: Transferring Capabilities from LLMs to VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12596","snapshot_observed_at":"2026-08-06T19:13:24.333743Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-07T05:46:33.320474Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:24.333743Z"},"links":{"cited_paper":"/paper/2403.12596","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:4485e959c27ade2b385bad1b3fb3e9740adeb6e5253181d9b0334cfdea031787","observation_id":"19b79cb6-d350-4e1a-b55f-207d2b621769","resolution":{"observed_at":"2026-08-06T19:13:24.333743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16483","last_updated":"2023-11-27T15:20:23Z","snapshot_observed_at":"2026-08-06T14:11:19.997270Z","submitted_at":"2023-11-27T15:20:23Z","title":"ChartLlama: A Multimodal LLM for Chart Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16483","snapshot_observed_at":"2026-08-06T19:13:24.426698Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-07T05:46:33.320474Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:24.426698Z"},"links":{"cited_paper":"/paper/2311.16483","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:b090cf0bcd0a9f516d16ffa83a3db440737561c6973e91da533a1fd351e1772c","observation_id":"651599da-b75b-4bf5-a8a6-0d9e8928bf6b","resolution":{"observed_at":"2026-08-06T19:13:24.426698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T19:13:24.545409Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-07T05:46:33.320474Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:24.545409Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:d0af1b486b9aa6d046142e8801644dea63fc532391c5c276dd4069b72cca2dc6","observation_id":"e3cac431-4703-4012-a7d0-1aba6291043e","resolution":{"observed_at":"2026-08-06T19:13:24.545409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:13:24.670393Z","title":"Farhan Ishmam, Md","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-07T05:46:33.320474Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:24.670393Z"},"links":{"citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:b4abf73149773edd9aabaf322c1946bce2a79d7254f3b03b87be640df5f49b2d","observation_id":"88c3bd8a-2ae0-4809-8960-838b84349693","resolution":{"observed_at":"2026-08-06T19:13:24.670393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11150","last_updated":"2024-11-17T18:52:06Z","snapshot_observed_at":"2026-07-06T19:51:37.262377Z","submitted_at":"2024-11-17T18:52:06Z","title":"A Comprehensive Survey on Visual Question Answering Datasets and Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11150","snapshot_observed_at":"2026-08-06T19:13:24.765236Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-07T05:46:33.320474Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:24.765236Z"},"links":{"cited_paper":"/paper/2411.11150","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:3096a59b336f5d84d174d8cf3f20aacf116401df1ee2a14aaa53e16fc898474a","observation_id":"38dfd1a9-4b6d-44c1-b93d-2e265a96ae96","resolution":{"observed_at":"2026-08-06T19:13:24.765236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-06T19:13:24.886671Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-07T05:46:33.320474Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:24.886671Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:e6628a69360a7c4ed8ed7ea5a03df0914d09b35b35b2727a955e0fa32c5d4e61","observation_id":"eed876b4-30a5-41f5-aa5c-ebc3e83ca83d","resolution":{"observed_at":"2026-08-06T19:13:24.886671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-06T19:13:24.964823Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-07T05:46:33.320474Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:24.964823Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:3541f4c0aaabbda76259228c7b5b63ebf9a30c61b5f4da68b396eaaa5c695380","observation_id":"ff1b53f2-dcc8-4d63-bc0f-25b7544b3dcb","resolution":{"observed_at":"2026-08-06T19:13:24.964823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14761","last_updated":"2023-10-10T23:39:25Z","snapshot_observed_at":"2026-08-03T20:34:57.164411Z","submitted_at":"2023-05-24T06:11:17Z","title":"UniChart: A Universal Vision-language Pretrained Model for Chart Comprehension and Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14761","snapshot_observed_at":"2026-08-06T19:13:25.075905Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-07T05:46:33.320474Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:25.075905Z"},"links":{"cited_paper":"/paper/2305.14761","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:d8ac3904148bc3c246a795265968ef9e27663dbec0fb881ab28fcbdf17d495d0","observation_id":"b4289eba-bdfa-4cda-9eb2-9d3971879692","resolution":{"observed_at":"2026-08-06T19:13:25.075905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-06T19:13:25.111434Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-07T05:46:33.320474Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:25.111434Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:d34e70f7d840ca0613330f57c5d5158c8304afea21ae5643e4d655059e7f293d","observation_id":"6baaecf6-9a99-4e9e-94b2-f2c15aff8955","resolution":{"observed_at":"2026-08-06T19:13:25.111434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-06T19:13:25.235115Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-07T05:46:33.320474Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:25.235115Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:fddd81893833d536c12f9e193c0e9511e30f8350f4d983d38e214f0e985f80a8","observation_id":"d31e54cf-6ef2-420c-9a96-2ed9844b3045","resolution":{"observed_at":"2026-08-06T19:13:25.235115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09413","last_updated":"2025-01-10T19:41:43Z","snapshot_observed_at":"2026-08-07T15:07:11.299326Z","submitted_at":"2024-07-12T16:37:59Z","title":"SPIQA: A Dataset for Multimodal Question Answering on Scientific Papers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.09413","snapshot_observed_at":"2026-08-06T19:13:25.301379Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-07T05:46:33.320474Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:25.301379Z"},"links":{"cited_paper":"/paper/2407.09413","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:feef04761602982b4ee09a8b5085fd18f57d1d9943a96512f2af987c03c9e058","observation_id":"176e75ca-64bb-44ce-bbe3-d5ae04c98d91","resolution":{"observed_at":"2026-08-06T19:13:25.301379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-06T19:13:25.320183Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-07T05:46:33.320474Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:25.320183Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:1370431a8ec6808c049bb3c2a2c976af1d1902040aee40401c3918aabc59a526","observation_id":"10d6402f-023e-44e9-8f6c-cbf7789d6985","resolution":{"observed_at":"2026-08-06T19:13:25.320183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-06T19:13:25.450751Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-07T05:46:33.320474Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:25.450751Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:f4a9cfdf2bc91073c3c6718a5dc2ec0cc55e0ee0f1c23ce86e6954043c3b598d","observation_id":"a293879e-2f35-481d-8f63-f527c0635758","resolution":{"observed_at":"2026-08-06T19:13:25.450751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18860","last_updated":"2025-02-28T04:18:19Z","snapshot_observed_at":"2026-08-07T17:48:07.298744Z","submitted_at":"2025-02-26T06:05:29Z","title":"Exploring Rewriting Approaches for Different Conversational Tasks","version":2},"cited_work":{"arxiv_id":"2502.18860","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.18860","snapshot_observed_at":"2026-08-06T19:13:27.202442Z","title":"Exploring Rewriting Approaches for Different Conversational Tasks","venue":"cs.CL","work_id":"d8284311-d7bf-48e1-8507-7b5a0e321b0a","year":2025},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-07T05:46:33.320474Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:25.559058Z"},"links":{"cited_paper":"/paper/2502.18860","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:10f2e3d757a15ac07551573f3542f6f5cb99a80fb8313c35afb7fa11651e80eb","observation_id":"de13ff66-f632-4326-be44-0280c4f4aa6b","resolution":{"observed_at":"2026-08-06T19:13:27.260471Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06186","last_updated":"2025-01-10T18:59:51Z","snapshot_observed_at":"2026-07-06T20:19:26.003822Z","submitted_at":"2025-01-10T18:59:51Z","title":"LlamaV-o1: Rethinking Step-by-step Visual Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06186","snapshot_observed_at":"2026-08-06T19:13:25.672059Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-07T05:46:33.320474Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:25.672059Z"},"links":{"cited_paper":"/paper/2501.06186","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:fa80730df2b0631ae4d283bd3d82d697404141f80c41664c5d0eefdba2aa895e","observation_id":"007578da-c4f2-4f92-89fe-3b8418d904da","resolution":{"observed_at":"2026-08-06T19:13:25.672059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-07-06T21:08:05.749656Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-08-06T19:13:25.782023Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-07T05:46:33.320474Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:25.782023Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:8492fa59f0e7001e0a9039ad7bc7a24aa0508d0f7eb69116729d5e7c205280c1","observation_id":"7f3dd424-524f-45f1-b19c-3ed16265bb52","resolution":{"observed_at":"2026-08-06T19:13:25.782023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:13:27.585479Z","title":null,"venue":null,"work_id":"36f0d124-d744-47dc-8cb4-64dba47164cb","year":2024},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-07T05:46:33.320474Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:25.915671Z"},"links":{"citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:f877263eaf6c1f08649509ee196ada2ac68bdaa3522622f74a176d02f526e457","observation_id":"2c086010-ccc6-4df4-bad9-24af0fb845d8","resolution":{"observed_at":"2026-08-06T19:13:27.670426Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-06T19:13:26.028106Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-07T05:46:33.320474Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:26.028106Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:54b30b6a1d44ea17e77f1dc63c1ad5574115ba4507941386b3b074edcfac3782","observation_id":"c2e00931-b974-435b-9879-eb8708346140","resolution":{"observed_at":"2026-08-06T19:13:26.028106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10601","last_updated":"2023-12-03T22:50:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T23:16:17Z","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10601","snapshot_observed_at":"2026-08-06T19:13:26.141905Z","title":"Griffiths, Yuan Cao, and Karthik Narasimhan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-07T05:46:33.320474Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:26.141905Z"},"links":{"cited_paper":"/paper/2305.10601","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:5a149e6bca6bed2e3deec031616fa1e08724e01cf4da9116706abf55d8080cc2","observation_id":"a23e7867-472e-4edc-8f2a-5adf0d707c99","resolution":{"observed_at":"2026-08-06T19:13:26.141905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03397","last_updated":"2025-05-29T13:20:34Z","snapshot_observed_at":"2026-08-05T00:32:55.139789Z","submitted_at":"2025-02-05T17:32:29Z","title":"SPRI: Aligning Large Language Models with Context-Situated Principles","version":2},"cited_work":{"arxiv_id":"2502.03397","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.03397","snapshot_observed_at":"2026-08-06T19:13:26.994234Z","title":"SPRI: Aligning Large Language Models with Context-Situated Principles","venue":"cs.CL","work_id":"ce7072ec-e194-449a-b3a1-2de6f28bd06b","year":2025},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-07T05:46:33.320474Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:26.256671Z"},"links":{"cited_paper":"/paper/2502.03397","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:144a83a8a281862464c2c9228c04131fdfbf57d4e809073b18925999829ccca0","observation_id":"da7a07fe-dd6e-4d25-8be5-d100c8cd1546","resolution":{"observed_at":"2026-08-06T19:13:27.061026Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T19:13:26.374962Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-07T05:46:33.320474Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:26.374962Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:d092325bb02a6215c3b291ba5007f825119b42ca4c3999ca1c66f7c96983dea3","observation_id":"9766eb6b-7fdc-418d-82cd-7f5121d6651e","resolution":{"observed_at":"2026-08-06T19:13:26.374962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T19:13:26.528077Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-07T05:46:33.320474Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:26.528077Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:09d6f4d2ab0b7ae8ed2fd0e64108c04251d13ee35cf4554ce3d9342f1b32dfa0","observation_id":"f79664c0-fd49-4a2b-9e86-14d2de44c813","resolution":{"observed_at":"2026-08-06T19:13:26.528077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:13:26.732433Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-07T05:46:33.320474Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:26.732433Z"},"links":{"citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:121d8687b76699e653806c31b2d9cb57eb83561e99786825eed1799f232379bb","observation_id":"4232198f-c475-4031-a872-c21921279274","resolution":{"observed_at":"2026-08-06T19:13:26.732433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:13:26.851065Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","snapshot_observed_at":"2026-08-07T05:46:33.320474Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T19:13:26.851065Z"},"links":{"citing_paper":"/paper/2507.06183"},"observation_digest":"sha256:ae739e363d642322da5f3dc9ff88fa1b7aa74546f526b9e4ac1f706c9040ba21","observation_id":"a0195551-95c0-4e78-b3de-2f939d32a89e","resolution":{"observed_at":"2026-08-06T19:13:26.851065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.06183","last_updated":"2025-07-08T17:05:42Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T05:46:33.320474Z","submitted_at":"2025-07-08T17:05:42Z","title":"Enhancing Scientific Visual Question Answering through Multimodal Reasoning and Ensemble Modeling"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":24,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 1 inbound Pith citation observation for arXiv:2507.06183."}