{"as_of":"2026-08-07T15:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ca1865d86f42085df2d366b99f94c6c072f957ae46e2584ef3d1ee16a062aaca","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:31:07.640675Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:30:31.136261Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T16:30:31.307464Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"cited_work":{"arxiv_id":"2507.10787","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.10787","snapshot_observed_at":"2026-08-06T16:30:31.307464Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","venue":"cs.CL","work_id":"75842fb0-7584-4f24-b8c6-d3e30f6bec84","year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.136261Z"},"links":{"cited_paper":"/paper/2507.10787","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:db58102dd9200ab8deb252b1e366d6f25d7eae77b6d4aaa892e325010e90fe30","observation_id":"ead4df80-43c5-4fa2-9cd1-94d2e2f83fb5","resolution":{"observed_at":"2026-08-06T16:30:31.315034Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.10787","snapshot_observed_at":"2026-08-01T15:17:47.809683Z","title":"minimally-guided meditation sessions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18514","last_updated":"2026-07-20T21:14:26Z","snapshot_observed_at":"2026-08-06T14:04:57.027817Z","submitted_at":"2026-07-20T21:14:26Z","title":"Querying Multimodal Scientific Papers with AI: Practices and Preferences Across Blind, Low-Vision, and Sighted Scientists","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T15:17:47.809683Z"},"links":{"cited_paper":"/paper/2507.10787","citing_paper":"/paper/2607.18514"},"observation_digest":"sha256:8a32fa24f6fb6e6816f64262f654a2e408edf19bbc8b0abb8f29a6b47bdaaf72","observation_id":"3cb0960e-baa3-40ee-8dd8-6a12d855d23e","resolution":{"observed_at":"2026-08-01T15:17:47.809683Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.10787/citation-record","integrity":"/paper/2507.10787/integrity","json":"/paper/2507.10787/citation-record.json","paper":"/paper/2507.10787"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:04.323749Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:04.323749Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:77a510b0b6360771d476cb862062e18c4f4c6747240f1a0df8a2fb13d384baa3","observation_id":"b99363ea-4eba-4f45-8a31-618e557dfc7e","resolution":{"observed_at":"2026-08-06T17:31:04.323749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:04.368718Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:04.368718Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:684caefe88b1a382dae0c74d97d53f0e3103977e5fdf844b89eafc57f6014368","observation_id":"22b8ac64-78bb-4577-b208-90f9b3d57665","resolution":{"observed_at":"2026-08-06T17:31:04.368718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-06T17:31:04.449817Z","title":"Hewett, Jamie Huynh, Mojan Javaheripi, Xin Jin, Piero Kauffmann, Nikos Karampatziakis, Dongwoo Kim, Mahoud Khademi, Lev Kurilenko, James R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:04.449817Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:b1617beab4c801f18ae2e5ad4db5349c63c180f77f35c9a073ffdd3ec775c05d","observation_id":"e5a9c3f9-7ae2-427f-ad34-0a138b266a2c","resolution":{"observed_at":"2026-08-06T17:31:04.449817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-06T17:31:04.531326Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:04.531326Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:a826e112768baa62dbef9932dce72e3ef0371a665dda8b5df14a832bde5b8e87","observation_id":"d0c3f4d7-8bda-4bd6-81b4-977f313e3971","resolution":{"observed_at":"2026-08-06T17:31:04.531326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:04.618409Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:04.618409Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:0c7be6326c79f637c803f26d9d0e14e24063f9ca076917c15e26defcc9c7aae8","observation_id":"10d16190-e8fe-4758-a848-72eb3ad647f2","resolution":{"observed_at":"2026-08-06T17:31:04.618409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.acl-long.118","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:07.911510Z","title":null,"venue":null,"work_id":"e01ddd97-7b6f-4627-828e-f28bb0c88320","year":2021},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:04.700004Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:23e324dbd6aaaa92a650a0a5d13bd12a90c5e2e06e86b08d7f6c2b9227db0393","observation_id":"8796e80b-e594-4dfc-b3ae-fb429502f2b2","resolution":{"observed_at":"2026-08-06T17:31:07.915627Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.09268","last_updated":"2018-10-31T14:46:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-11-28T18:14:11Z","title":"MS MARCO: A Human Generated MAchine Reading COmprehension Dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.09268","snapshot_observed_at":"2026-08-06T17:31:04.765970Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:04.765970Z"},"links":{"cited_paper":"/paper/1611.09268","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:ad74ba9408659d537751156fd3d49e99291b3503d4abd416cf00d2bb66f2e2bb","observation_id":"c80a5182-77eb-4fdb-a94a-293e18d099f3","resolution":{"observed_at":"2026-08-06T17:31:04.765970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-06T17:31:04.848240Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:04.848240Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:5e4b0d108cfc3db9fe6c6507bf903b123e52f575f81a0b379d6216bff4519631","observation_id":"6c9aea2e-7410-445c-bd98-77cece668d73","resolution":{"observed_at":"2026-08-06T17:31:04.848240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T17:31:04.922812Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:04.922812Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:6d03ce64e1951fb3f514d0036a7fed595f5e8560c34346e998d73817b2806692","observation_id":"2a2f54cb-e7dd-42e1-a323-b373eb3fdae1","resolution":{"observed_at":"2026-08-06T17:31:04.922812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-06T17:31:04.978209Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:04.978209Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:a8ea3a07fa514c222113f727ab784ff7deaf73dacb12286f92d369a7bcd57cbf","observation_id":"eb287d19-60e0-4833-bc07-d339cb19759a","resolution":{"observed_at":"2026-08-06T17:31:04.978209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-06T17:31:05.069827Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:05.069827Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:7f428512bc0b8975a6385b35bd7e04a0787c43aea5d27a1fc62692070bb125e3","observation_id":"2ecd8669-a16f-498e-b133-1fe15789f6cc","resolution":{"observed_at":"2026-08-06T17:31:05.069827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:05.124722Z","title":"Smith, and Matt Gardner","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:05.124722Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:59d7e9b8bd7fc05838824e372b94d1233ce03e2322825d4fe6181e1865bc8bf9","observation_id":"01f40b6c-1388-4925-935b-3c80a3c64945","resolution":{"observed_at":"2026-08-06T17:31:05.124722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:05.179283Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:05.179283Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:2ece3d3e490972466086e6e6d493d8082c17a7d24078e07db87e5a30c7c53c80","observation_id":"ba029efd-9a29-4598-842a-ecdc1239bbfa","resolution":{"observed_at":"2026-08-06T17:31:05.179283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T17:31:05.239219Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:05.239219Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:8207774b123979419ec32486de26b7ca7ad3182a458383fc3a9e8c9c91f150dd","observation_id":"ae6f7e57-0837-4593-90c2-e9a1119cd005","resolution":{"observed_at":"2026-08-06T17:31:05.239219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T17:31:05.302054Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:05.302054Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:0ce2cc16e3676c1ddaf5356ae8d392b6651c4ed057fa93734105f6398622fbd3","observation_id":"334e95ce-cf68-4d40-b4cb-ef0ce284bd34","resolution":{"observed_at":"2026-08-06T17:31:05.302054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:08.421247Z","title":null,"venue":null,"work_id":"8f770a21-1779-4980-a24f-875e12f26f87","year":2023},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:05.371769Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:5fd7c870cb9f1732a8e931a4558f5f538314964b4f73952912930efed0558788","observation_id":"e7f99c1a-1018-4d7b-bff9-8b28c0c992df","resolution":{"observed_at":"2026-08-06T17:31:08.425295Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:08.406790Z","title":null,"venue":null,"work_id":"4451eb1d-d5ac-4a89-b8b2-ce0b7b00dcf5","year":2023},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:05.430239Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:5a829a644de38295324d3548531fc6688de32b00d15de6c73466066936aa78f6","observation_id":"1d59d37e-19a2-4f80-9f12-16762b631892","resolution":{"observed_at":"2026-08-06T17:31:08.411100Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:05.509779Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:05.509779Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:a0090877cb50ded32ba11841c433fdef2fd56d21382e420ae1548402c935a7a1","observation_id":"b5e4b3d7-6af4-49fa-8111-1af61f880c86","resolution":{"observed_at":"2026-08-06T17:31:05.509779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:05.593337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:05.593337Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:0f5c1f2f9db6f7fdfe44296e74ea47f20c17d9b06be7f04f8883b02c1e94f837","observation_id":"cdb25fbd-cde1-407a-9467-8abdd9faef52","resolution":{"observed_at":"2026-08-06T17:31:05.593337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00231","last_updated":"2024-06-02T15:47:16Z","snapshot_observed_at":"2026-07-06T17:37:52.514730Z","submitted_at":"2024-03-01T02:21:30Z","title":"Multimodal ArXiv: A Dataset for Improving Scientific Comprehension of Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00231","snapshot_observed_at":"2026-08-06T17:31:05.650761Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:05.650761Z"},"links":{"cited_paper":"/paper/2403.00231","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:280a16f24cf48671257e3f46a1c2c2ff661e89079ef2b6909f80286a182fede0","observation_id":"c8a5e407-34d7-4780-8eaf-88fd4a99f7d5","resolution":{"observed_at":"2026-08-06T17:31:05.650761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04903","last_updated":"2025-02-20T05:57:34Z","snapshot_observed_at":"2026-07-06T18:42:14.020553Z","submitted_at":"2024-07-06T00:40:53Z","title":"MMSci: A Dataset for Graduate-Level Multi-Discipline Multimodal Scientific Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04903","snapshot_observed_at":"2026-08-06T17:31:05.740970Z","title":"Wilson, Woosang Lim, and William Yang Wang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:05.740970Z"},"links":{"cited_paper":"/paper/2407.04903","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:a36f7778238c8c980087296cdeaf7bec15e709e777dab3075714d42ed8cdff53","observation_id":"044ab6aa-2244-4981-92ce-04b773551df5","resolution":{"observed_at":"2026-08-06T17:31:05.740970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:05.826505Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:05.826505Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:260233f2bb68b9f0032f5c83d2a02de171c70c7966aa19451d8d8c5c6c75028e","observation_id":"3eb3f74c-c218-4016-a650-a18040ae32b7","resolution":{"observed_at":"2026-08-06T17:31:05.826505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-06T17:31:05.896510Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:05.896510Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:6868129942c27fb7d79eae6d78b1cb8987850fb3ec62139f2b3862a83e9451bb","observation_id":"b24dc2c8-4c71-4aa0-9aad-a0637e9209e8","resolution":{"observed_at":"2026-08-06T17:31:05.896510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:08.384260Z","title":null,"venue":null,"work_id":"62315530-6f7b-44ac-8dba-e5f148f284bd","year":2025},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:05.964673Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:952e20fb46d26ae2c4a3452df2b3dacf601e2c588de987b9111e8a9766f6e8af","observation_id":"25142980-5bc6-4eb2-b329-93ce83754834","resolution":{"observed_at":"2026-08-06T17:31:08.388176Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:06.049930Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:06.049930Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:96d1d95e544a1c81db1a52160dbef75d1be9167d5ee504019c554f40f06b0f2e","observation_id":"382fc33b-16e6-4699-aaba-acd5827d985f","resolution":{"observed_at":"2026-08-06T17:31:06.049930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:06.136390Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:06.136390Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:bf8b181390d7c772da3dd7f25b8b32f410c748b7261c3767c1658ecaa3b1ef01","observation_id":"71bd2513-1153-4eab-b086-c74f2c90175a","resolution":{"observed_at":"2026-08-06T17:31:06.136390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:06.217193Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:06.217193Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:0aa5e875a9fff1f951c5ffd5a606bb1b1ddaaaa89edf8c3c7db1e5374587a6c4","observation_id":"bb40fc52-03d6-4547-9925-b7af17cad8d1","resolution":{"observed_at":"2026-08-06T17:31:06.217193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:06.304628Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:06.304628Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:845555da99bcf2784e83ba3134c80709a80606aa83af7731a1b02ab20f06367b","observation_id":"6c352d2f-aa14-4ffc-a768-154632781046","resolution":{"observed_at":"2026-08-06T17:31:06.304628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.05250","last_updated":"2016-10-11T02:42:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-06-16T16:36:00Z","title":"SQuAD: 100,000+ Questions for Machine Comprehension of Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.05250","snapshot_observed_at":"2026-08-06T17:31:06.331385Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:06.331385Z"},"links":{"cited_paper":"/paper/1606.05250","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:8c7d312913e5c10fc8244f868db1e8395c7644125c87fc0c64682333d8ca09f3","observation_id":"6275a39d-90ca-4360-87a1-9d12b2d43538","resolution":{"observed_at":"2026-08-06T17:31:06.331385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.naacl-main.79","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:07.757387Z","title":null,"venue":null,"work_id":"c0702b84-a83b-48df-a25e-b75281258362","year":2022},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:06.420771Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:736b0b38b8e5e8630a7cdb8b66ddf8e5f0c48f36a149dd2e5cb8f5c45e1da442","observation_id":"1191d5ff-83d9-4e54-a420-914825945272","resolution":{"observed_at":"2026-08-06T17:31:07.848985Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T17:31:06.587372Z","title":"Stone, Peter Albert, Amjad Almahairi, Yasmine Babaei, Nikolay Bashlykov, Soumya Batra, Prajjwal Bhargava, Shruti Bhosale, Daniel M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:06.587372Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:b4cfe9b76c11fd3af1cc07cb1058394be2c334e94276f86cdde74af0e40ba845","observation_id":"da3d9eed-3254-4b24-94c5-9dc8ff57d16a","resolution":{"observed_at":"2026-08-06T17:31:06.587372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15569","last_updated":"2025-06-18T15:43:26Z","snapshot_observed_at":"2026-08-06T23:50:35.476736Z","submitted_at":"2025-06-18T15:43:26Z","title":"SciVer: Evaluating Foundation Models for Multimodal Scientific Claim Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15569","snapshot_observed_at":"2026-08-06T17:31:06.719392Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:06.719392Z"},"links":{"cited_paper":"/paper/2506.15569","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:92cff504768f8122daa9022dee05fccbf8f87ca3c1b6a93ff2fe4c49b261591f","observation_id":"d7e8f31e-7830-455b-b15c-479061fff83a","resolution":{"observed_at":"2026-08-06T17:31:06.719392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T17:31:06.846126Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:06.846126Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:8b86b7af4d46b5b1355993ac52d1ddc698cc356ef3164e1cb0e1ff59793093e4","observation_id":"a08a52fe-df0c-4079-b01b-81d1fc293408","resolution":{"observed_at":"2026-08-06T17:31:06.846126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18521","last_updated":"2024-06-26T17:50:11Z","snapshot_observed_at":"2026-08-06T23:04:27.981034Z","submitted_at":"2024-06-26T17:50:11Z","title":"CharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18521","snapshot_observed_at":"2026-08-06T17:31:06.931509Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:06.931509Z"},"links":{"cited_paper":"/paper/2406.18521","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:42f1e33a65fc3654d4263ae5f15ac84143d7f054ccf76a454f9537b38812fc6e","observation_id":"25ae9e10-aa6b-45d5-90ff-4765489183a7","resolution":{"observed_at":"2026-08-06T17:31:06.931509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02694","last_updated":"2025-07-03T15:04:38Z","snapshot_observed_at":"2026-08-07T02:29:11.672901Z","submitted_at":"2025-07-03T15:04:38Z","title":"Can LLMs Identify Critical Limitations within Scientific Research? A Systematic Evaluation on AI Research Papers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02694","snapshot_observed_at":"2026-08-06T17:31:07.060555Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:07.060555Z"},"links":{"cited_paper":"/paper/2507.02694","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:e606edd83da99f7963ca28b88cf67beff713ca126851a50d641d2b9e477f8409","observation_id":"36f04ad3-bf4c-4a99-8588-f4fc60c3fc6b","resolution":{"observed_at":"2026-08-06T17:31:07.060555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-07-31T11:19:06.421362Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-06T17:31:07.197864Z","title":"Cohen, Ruslan Salakhutdinov, and Christopher D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:07.197864Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:ba9a4b8226bd609835a27ce2355ac6b48478787d35ab26a802c1f37826e0cc43","observation_id":"efda6167-a745-4e83-a8d0-db77df776e65","resolution":{"observed_at":"2026-08-06T17:31:07.197864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-06T17:31:07.341130Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:07.341130Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:5cd7f3a5e0f2389f9dc6f1f251a5acde0d8adfe4860bb802bfe6853fd6c1f8be","observation_id":"21d1c6a6-bd64-4f82-866a-66be6cb485c1","resolution":{"observed_at":"2026-08-06T17:31:07.341130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-04T04:40:00.850270Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-08-06T17:31:07.461658Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:07.461658Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:97b50a42f99caf55d89f6347047b18af4694c404efb6e78445f9b0a142b47792","observation_id":"97a6cfaf-e4f6-460f-89ee-bf1172063639","resolution":{"observed_at":"2026-08-06T17:31:07.461658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:08.340441Z","title":null,"venue":null,"work_id":"d70eef36-ace9-441d-b175-c36a3cfab988","year":2025},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:07.560041Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:b7eeae282795ff87e93b94f3cb8c1c46130456c2c6ff3df6f8a8961c1bf26291","observation_id":"abf220af-2417-422e-a176-c5b2eeabcc1c","resolution":{"observed_at":"2026-08-06T17:31:08.345290Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:31:07.640675Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T17:31:07.640675Z"},"links":{"citing_paper":"/paper/2507.10787"},"observation_digest":"sha256:d80306419256f45727ab729faebee088b8805f3529fd5c673e56224e7f3b3a5c","observation_id":"39fcad47-da71-48c5-9064-ca3947aff16e","resolution":{"observed_at":"2026-08-06T17:31:07.640675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 2 inbound Pith citation observations for arXiv:2507.10787."}