{"as_of":"2026-08-09T13:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3dbe9f1a124f76b65291514b6c594220b0975418f71f61937a9074189c15f22e","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:53:05.141147Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.21596/citation-record","integrity":"/paper/2506.21596/integrity","json":"/paper/2506.21596/citation-record.json","paper":"/paper/2506.21596"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:03.563420Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-09T10:42:58.604320Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:03.563420Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:4d45746750b977e8ed3204392067fe0b8a1da17ab59e635fa4ce294955286c02","observation_id":"fae8a539-5ada-4a15-8b65-ee2a7d11eaa7","resolution":{"observed_at":"2026-08-06T23:53:03.563420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-06T23:53:03.623288Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-09T10:42:58.604320Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:03.623288Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:27af9f0f117d4cb8ceeb18bbcba4cf30723a15ac22e8f4d1bfb492a2d85879fa","observation_id":"00f0d1c9-a049-4ace-ba4c-bde3bd43e63d","resolution":{"observed_at":"2026-08-06T23:53:03.623288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T23:53:03.679170Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-09T10:42:58.604320Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:03.679170Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:d90ed0d7dc6d08eda7e303db625231b28380abd158639f7e776f2f6c37c86cfb","observation_id":"4d946e54-d937-4ff2-b146-3688b3a99d89","resolution":{"observed_at":"2026-08-06T23:53:03.679170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:08.982277Z","title":"Taking the next step with generative artificial intelligence: The transformative role of multimodal large language models in science education,","venue":null,"work_id":"433abe08-5603-4ecb-8c24-0c665d79f8ff","year":2025},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-09T10:42:58.604320Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:03.747155Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:358f32babecae86b6fa68fea106997dd63ac64c1a363e9df69ef5430e90acf25","observation_id":"7bd79d0f-16e8-494e-a535-8c84e774f444","resolution":{"observed_at":"2026-08-06T23:53:09.040655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:08.821487Z","title":"On opportunities and challenges of large multimodal foundation models in education,","venue":null,"work_id":"aef3ec17-13eb-4988-8c84-e8a94cc202f5","year":2025},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-09T10:42:58.604320Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:03.838513Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:397ef8d66259795d27a172e8caaf0fecdba7fc0d7dda8a869448eb531b37d763","observation_id":"7ce0486e-a7fe-4841-9a56-18d74747f6c9","resolution":{"observed_at":"2026-08-06T23:53:08.905573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:08.712019Z","title":"Are you smarter than a sixth grader? textbook question an- swering for multimodal machine comprehension,","venue":null,"work_id":"c43908d3-56af-43b7-97ca-cbeb18f92f5f","year":2017},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-09T10:42:58.604320Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:03.910260Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:0f1be10e737c0c4a3b747d584796f89b6db344b22df5d7e6eccef4874e680596","observation_id":"84789112-6207-439f-af96-0dcb1a5516bb","resolution":{"observed_at":"2026-08-06T23:53:08.772329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:08.542503Z","title":"A review on vision-language-based approaches: Challenges and applications,","venue":null,"work_id":"e771f4bb-19fa-425c-99de-cad285ea7f9e","year":2025},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-09T10:42:58.604320Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:03.979107Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:1c56818b7ee288e4510c03a7cccac65b0a04b0049f06a99c0f75887014c4a6dd","observation_id":"151a1e35-aeab-43f6-92c5-1e26822f2f62","resolution":{"observed_at":"2026-08-06T23:53:08.624559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:08.413151Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":"ac1d1807-8dd3-467e-8b7e-edd6c7dc1abf","year":2023},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-09T10:42:58.604320Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.026641Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:0d43554bdec715eab3d68861b42e8cafc25e38aa3df80a6cb7b11c6b2f22fff6","observation_id":"c3a08743-84a5-47c9-9a33-7446f9f640aa","resolution":{"observed_at":"2026-08-06T23:53:08.480404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:08.252986Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":"67e2a040-6181-43c3-b257-5b8efe502fe1","year":2024},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-09T10:42:58.604320Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.086129Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:61d2d1edadff23a2aa10787d423ec4de2791a67ff886b4052d2af148fe22e4bd","observation_id":"f5eeea5c-cbeb-44a8-ae56-fd4e724b9905","resolution":{"observed_at":"2026-08-06T23:53:08.330726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:08.078871Z","title":"Making the v in VQA matter: Elevating the role of image understanding in visual question answering,","venue":null,"work_id":"55b98bd3-385e-4e01-aaf5-39ff22cc93e8","year":2017},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-09T10:42:58.604320Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.143669Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:9ef31fa00bf548d6660ba549acbe4c16bcb6799b685c4e4cde6278871b722a14","observation_id":"27591440-ac1b-49a3-ab2e-1d280f14405a","resolution":{"observed_at":"2026-08-06T23:53:08.189944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:07.864761Z","title":"Ok-VQA: A visual question answering benchmark requiring external knowledge,","venue":null,"work_id":"4d632718-ce41-4aa5-8021-c796ed3f7f1c","year":2019},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-09T10:42:58.604320Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.184296Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:c3be4676c6435ebdd7d21fab1cb87a7c92c3effdc4b1cb08e09ef6b9cd16568d","observation_id":"8849f29d-7b38-406b-bb3d-46f2ce5e6da2","resolution":{"observed_at":"2026-08-06T23:53:08.013450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:07.552812Z","title":"Microsoft COCO: Common objects in context,","venue":null,"work_id":"0bf13cde-d791-46a7-85c6-e8a0cfd3ecf1","year":2014},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-09T10:42:58.604320Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.276954Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:555e741cdb62a84f743dfd714c6b6d18c361de3b79ae4acd709b488f4f88764d","observation_id":"d620872c-86af-4ed9-9521-eeafac3d6cac","resolution":{"observed_at":"2026-08-06T23:53:07.691252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.09413","last_updated":"2025-01-10T19:41:43Z","snapshot_observed_at":"2026-08-09T10:42:35.127499Z","submitted_at":"2024-07-12T16:37:59Z","title":"SPIQA: A Dataset for Multimodal Question Answering on Scientific Papers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.09413","snapshot_observed_at":"2026-08-06T23:53:04.357027Z","title":"SPIQA: A dataset for multimodal question answering on scientific papers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-09T10:42:58.604320Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.357027Z"},"links":{"cited_paper":"/paper/2407.09413","citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:e00b6098f022e9807f07d1c2a6c55a58155169f1a85c4f1d00abdab57f64efa0","observation_id":"f6143b45-6167-4c8f-ac0a-421e7d3d17e2","resolution":{"observed_at":"2026-08-06T23:53:04.357027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:07.318376Z","title":"Eduvqa: A multimodal visual question answering framework for smart education,","venue":null,"work_id":"6bf22538-2b9e-45e1-89cf-c2eccffe2946","year":2025},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-09T10:42:58.604320Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.425031Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:1d7df591cefc94748a06291b2710bb6440af973f9369c5fa4344081749501317","observation_id":"0ea08724-8e05-4920-9e19-52d5ca82ee55","resolution":{"observed_at":"2026-08-06T23:53:07.417384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:07.030373Z","title":"Enhancing textual textbook question answering with large language models and retrieval augmented generation,","venue":null,"work_id":"8123ecac-1654-434a-ad18-6b6f29badea9","year":2025},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-09T10:42:58.604320Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.508308Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:546718ce884b27c72ddaf698d6c5d8094f58123250257587f240b3c05a6dde72","observation_id":"d54e57bf-b35c-4e3e-a1f2-94a3233472c4","resolution":{"observed_at":"2026-08-06T23:53:07.151392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:06.784446Z","title":"Enhancing textbook question answering with knowledge graph-augmented large language models,","venue":null,"work_id":"2f06d6f4-afe0-4ef0-aa0f-4a9f1e17e83e","year":2024},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-09T10:42:58.604320Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.614008Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:2a720318d56812f18b137f2a42a62826cd518e3885b65ad30932916f9281f7b4","observation_id":"57cf384d-eed3-4364-b65d-c3f0844c66a5","resolution":{"observed_at":"2026-08-06T23:53:06.928385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:06.507952Z","title":"ISAAQ - mastering textbook questions with pre-trained transformers and bottom-up and top-down attention,","venue":null,"work_id":"792d7e63-0529-436b-b176-9b550ff189da","year":2020},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-09T10:42:58.604320Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.676803Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:34182fe6668cebfda099dc3b20feeaba18d0b1dfe2dce1fc43c55e05a59d5582","observation_id":"f75ebdc2-61c3-4db1-8337-07a1e4745380","resolution":{"observed_at":"2026-08-06T23:53:06.642236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:06.233059Z","title":"Imagebind: One embedding space to bind them all,","venue":null,"work_id":"29507ea6-4fc2-421d-a445-41085500d814","year":2023},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-09T10:42:58.604320Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.754929Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:e685c2dbd2451150855087ff28d1d42426cab4df82e02dafe540404197310447","observation_id":"921db7cb-37bc-4d69-abda-1a6b2cb389f5","resolution":{"observed_at":"2026-08-06T23:53:06.355230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:05.963894Z","title":"KDB.AI: The scalable vector database for ai,","venue":null,"work_id":"e519f45a-2bd1-4cd2-9894-26d3fcb7b479","year":2023},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-09T10:42:58.604320Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.846424Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:698d5d4693467bb9dec6a1430c0c9544080cee5144ba8870b580bbb317764b61","observation_id":"44b78eb2-0f23-4782-ab3a-a9a17102ef91","resolution":{"observed_at":"2026-08-06T23:53:06.116786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:05.673580Z","title":"GPT-4v(ision) system card,","venue":null,"work_id":"a77cf498-c9c7-402c-8d23-06cad93f9974","year":2023},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-09T10:42:58.604320Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.897266Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:cd864c30fcef5b8e74956195b955822b74688cd12b7192c6d98cfd4aa8e16077","observation_id":"0c0e506f-a6b0-4bfb-a07f-4847e7c6b754","resolution":{"observed_at":"2026-08-06T23:53:05.828269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T23:53:04.903476Z","title":"Gemini: A family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-09T10:42:58.604320Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.903476Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:d4f2b39b474ba5ee0b36156ba2cc6d30c81cd449509b204d9901d9b8bd6b1a24","observation_id":"8b00df41-b0d4-4458-a67e-8354fd5278a6","resolution":{"observed_at":"2026-08-06T23:53:04.903476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:05.488014Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"ac10ee82-9d17-4674-b374-fc6e62ab0bb5","year":2021},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-09T10:42:58.604320Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:04.997136Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:a98bb16ae1fdef861be93e978a258eedec40c6d1e44725b30902357b2a8e516b","observation_id":"af04fca8-030e-4bf4-95f4-b09c94cea7f5","resolution":{"observed_at":"2026-08-06T23:53:05.582385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:53:05.310933Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90% chatgpt quality,","venue":null,"work_id":"7d5afb64-8922-4358-819c-379f8b59ead3","year":2023},"citing_paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","snapshot_observed_at":"2026-08-09T10:42:58.604320Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:53:05.141147Z"},"links":{"citing_paper":"/paper/2506.21596"},"observation_digest":"sha256:fcab2158c3356e9d3e4d315228e36546b8ea55383e2fe529a1305984d29cb612","observation_id":"8e02cfc0-9382-4039-afa1-b29ccdf59431","resolution":{"observed_at":"2026-08-06T23:53:05.393712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.21596","last_updated":"2025-07-15T09:14:31Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T10:42:58.604320Z","submitted_at":"2025-06-18T19:31:35Z","title":"Evaluating Multimodal Large Language Models on Educational Textbook Question Answering"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2506.21596."}