{"as_of":"2026-08-16T23:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6d060ebc6d10d904b3a5b5878681e028ae44f839f33218cbbe7b6418221ef6f9","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T20:32:18.470918Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16604/citation-record","integrity":"/paper/2607.16604/integrity","json":"/paper/2607.16604/citation-record.json","paper":"/paper/2607.16604"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:32:16.251203Z","title":"Retrieval-augmented generation for knowledge-intensive NLP tasks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16604","last_updated":"2026-07-18T02:49:26Z","snapshot_observed_at":"2026-08-15T19:33:50.667669Z","submitted_at":"2026-07-18T02:49:26Z","title":"When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T20:32:16.251203Z"},"links":{"citing_paper":"/paper/2607.16604"},"observation_digest":"sha256:906bb0bdb3c2a586642dc7a088c0e462c58993929bf7abd5afc843541b5e5d8c","observation_id":"4538cbe8-2dbb-475d-a672-4ffbaf2b5c3d","resolution":{"observed_at":"2026-08-01T20:32:16.251203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-01T20:32:16.307158Z","title":"Retrieval-augmented generation for large language models: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16604","last_updated":"2026-07-18T02:49:26Z","snapshot_observed_at":"2026-08-15T19:33:50.667669Z","submitted_at":"2026-07-18T02:49:26Z","title":"When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T20:32:16.307158Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2607.16604"},"observation_digest":"sha256:e941e3aef6e3612abbbd28942bf4ae8b3cdf4bc3111c867d206ba56afcaa9164","observation_id":"b2484dc6-277a-4892-a94f-9a32cfe08242","resolution":{"observed_at":"2026-08-01T20:32:16.307158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:32:16.383796Z","title":"CRAG – comprehensive RAG benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16604","last_updated":"2026-07-18T02:49:26Z","snapshot_observed_at":"2026-08-15T19:33:50.667669Z","submitted_at":"2026-07-18T02:49:26Z","title":"When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T20:32:16.383796Z"},"links":{"citing_paper":"/paper/2607.16604"},"observation_digest":"sha256:feca70b17e4365d4409f27071bc630756fba22799d7fab625980d0bafd800128","observation_id":"ebd6590b-41cf-4959-9b21-89f4ffb1fc38","resolution":{"observed_at":"2026-08-01T20:32:16.383796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:32:16.451693Z","title":"PixelRAG: Web screenshots beat text for retrieval-augmented generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16604","last_updated":"2026-07-18T02:49:26Z","snapshot_observed_at":"2026-08-15T19:33:50.667669Z","submitted_at":"2026-07-18T02:49:26Z","title":"When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T20:32:16.451693Z"},"links":{"citing_paper":"/paper/2607.16604"},"observation_digest":"sha256:52a7eea91e33432cd5963e60eef13cf63cf38f5909a5aac634d5a661fd6414c2","observation_id":"3aa02689-8a88-4a35-b7de-de4ce9f9e8ad","resolution":{"observed_at":"2026-08-01T20:32:16.451693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:32:16.533879Z","title":"MMed-RAG: Versatile multimodal RAG system for medical vision language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16604","last_updated":"2026-07-18T02:49:26Z","snapshot_observed_at":"2026-08-15T19:33:50.667669Z","submitted_at":"2026-07-18T02:49:26Z","title":"When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T20:32:16.533879Z"},"links":{"citing_paper":"/paper/2607.16604"},"observation_digest":"sha256:e211dd3c96e10813d51bc2ba0867578be28b61c8f5370e934d2d62c928802016","observation_id":"5c41c072-4d1d-4c41-a45b-bcd9ca294923","resolution":{"observed_at":"2026-08-01T20:32:16.533879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01449","last_updated":"2025-02-28T08:51:57Z","snapshot_observed_at":"2026-08-16T08:25:38.532489Z","submitted_at":"2024-06-27T15:45:29Z","title":"ColPali: Efficient Document Retrieval with Vision Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01449","snapshot_observed_at":"2026-08-01T20:32:16.609691Z","title":"ColPali: Efficient document retrieval with vision language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16604","last_updated":"2026-07-18T02:49:26Z","snapshot_observed_at":"2026-08-15T19:33:50.667669Z","submitted_at":"2026-07-18T02:49:26Z","title":"When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T20:32:16.609691Z"},"links":{"cited_paper":"/paper/2407.01449","citing_paper":"/paper/2607.16604"},"observation_digest":"sha256:ec16e818a5fab4a511a77cbaf43e13ae1900593f90d5398c98a857d8047d4c95","observation_id":"71cda8c7-be2b-4456-8664-0d00a92680bd","resolution":{"observed_at":"2026-08-01T20:32:16.609691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16130","last_updated":"2025-02-19T10:49:41Z","snapshot_observed_at":"2026-08-16T12:38:40.131901Z","submitted_at":"2024-04-24T18:38:11Z","title":"From Local to Global: A Graph RAG Approach to Query-Focused Summarization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16130","snapshot_observed_at":"2026-08-01T20:32:16.683589Z","title":"From local to global: A graph RAG approach to query- focused summarization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16604","last_updated":"2026-07-18T02:49:26Z","snapshot_observed_at":"2026-08-15T19:33:50.667669Z","submitted_at":"2026-07-18T02:49:26Z","title":"When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T20:32:16.683589Z"},"links":{"cited_paper":"/paper/2404.16130","citing_paper":"/paper/2607.16604"},"observation_digest":"sha256:0b8cb6db5124c034a520a9a9b078281b81d463c312ff7e7709e9570764029f7a","observation_id":"38202c8e-1352-40f8-8e5f-49333e582865","resolution":{"observed_at":"2026-08-01T20:32:16.683589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04952","last_updated":"2024-11-07T18:29:38Z","snapshot_observed_at":"2026-08-16T13:02:00.632196Z","submitted_at":"2024-11-07T18:29:38Z","title":"M3DocRAG: Multi-modal Retrieval is What You Need for Multi-page Multi-document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04952","snapshot_observed_at":"2026-08-01T20:32:16.757013Z","title":"M3DocRAG: Multi-modal retrieval is what you need for multi-page multi-document understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16604","last_updated":"2026-07-18T02:49:26Z","snapshot_observed_at":"2026-08-15T19:33:50.667669Z","submitted_at":"2026-07-18T02:49:26Z","title":"When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T20:32:16.757013Z"},"links":{"cited_paper":"/paper/2411.04952","citing_paper":"/paper/2607.16604"},"observation_digest":"sha256:fc79ea1acf56c3c1d72d2c0ce238ac099f1cde4c04f930b5a9a93aa671c82840","observation_id":"2961fbf4-4c70-4e04-b49f-5794a096b1ba","resolution":{"observed_at":"2026-08-01T20:32:16.757013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:32:16.831867Z","title":"Bench- marking retrieval-augmented multimodal generation for document ques- tion answering,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16604","last_updated":"2026-07-18T02:49:26Z","snapshot_observed_at":"2026-08-15T19:33:50.667669Z","submitted_at":"2026-07-18T02:49:26Z","title":"When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T20:32:16.831867Z"},"links":{"citing_paper":"/paper/2607.16604"},"observation_digest":"sha256:ef13408ff2cab20ba7c2d68a720cb03b20185c2c5f0caf52ade7f01d3c3c9bac","observation_id":"75a98041-c246-4ae1-b583-61b5df60b1d7","resolution":{"observed_at":"2026-08-01T20:32:16.831867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.26458","last_updated":"2026-06-24T23:38:42Z","snapshot_observed_at":"2026-08-16T15:36:17.486303Z","submitted_at":"2026-06-24T23:38:42Z","title":"MKG-RAG-Bench: Benchmarking Retrieval in Multimodal Knowledge Graph-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.26458","snapshot_observed_at":"2026-08-01T20:32:16.940686Z","title":"MKG-RAG-Bench: Benchmarking retrieval in multimodal knowledge graph-augmented gen- eration,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16604","last_updated":"2026-07-18T02:49:26Z","snapshot_observed_at":"2026-08-15T19:33:50.667669Z","submitted_at":"2026-07-18T02:49:26Z","title":"When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T20:32:16.940686Z"},"links":{"cited_paper":"/paper/2606.26458","citing_paper":"/paper/2607.16604"},"observation_digest":"sha256:c2020849b416bfdf06f49c88ea6c2037e18e11ef548056753148faeff5bcb522","observation_id":"a947caf0-4aec-494c-b325-d19702c61a1c","resolution":{"observed_at":"2026-08-01T20:32:16.940686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.28780","last_updated":"2026-06-27T07:14:31Z","snapshot_observed_at":"2026-08-08T11:51:53.982939Z","submitted_at":"2026-06-27T07:14:31Z","title":"Multimodal Graph RAG for Long-range Visually Rich Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.28780","snapshot_observed_at":"2026-08-01T20:32:17.046207Z","title":"Multimodal graph RAG for long-range vi- sually rich document understanding,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16604","last_updated":"2026-07-18T02:49:26Z","snapshot_observed_at":"2026-08-15T19:33:50.667669Z","submitted_at":"2026-07-18T02:49:26Z","title":"When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T20:32:17.046207Z"},"links":{"cited_paper":"/paper/2606.28780","citing_paper":"/paper/2607.16604"},"observation_digest":"sha256:5c47c923c8fd1b3c57d8348404b265f89f60e4404e83b32c42634a574f678011","observation_id":"0df98cbf-d124-4e4b-8a18-b8a3ec85d35a","resolution":{"observed_at":"2026-08-01T20:32:17.046207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:32:17.141690Z","title":"PubLayNet: Largest dataset ever for document layout analysis,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16604","last_updated":"2026-07-18T02:49:26Z","snapshot_observed_at":"2026-08-15T19:33:50.667669Z","submitted_at":"2026-07-18T02:49:26Z","title":"When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T20:32:17.141690Z"},"links":{"citing_paper":"/paper/2607.16604"},"observation_digest":"sha256:bb163d61a7fff0cc832df1a07cbb18786300a95cbc1f6017b503fa3ec06ecf30","observation_id":"c65138aa-1e9e-4bbc-b82e-20bfc427b024","resolution":{"observed_at":"2026-08-01T20:32:17.141690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:32:17.238396Z","title":"Dense passage retrieval for open-domain question an- swering,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16604","last_updated":"2026-07-18T02:49:26Z","snapshot_observed_at":"2026-08-15T19:33:50.667669Z","submitted_at":"2026-07-18T02:49:26Z","title":"When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T20:32:17.238396Z"},"links":{"citing_paper":"/paper/2607.16604"},"observation_digest":"sha256:d833e68d0fe4f17b2bc62220876eec6388d1bb66c132049e55fd5b1fc8a925f7","observation_id":"72ea4953-00d7-43b3-bd4c-2f6c05371d90","resolution":{"observed_at":"2026-08-01T20:32:17.238396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:32:17.311439Z","title":"RAGAS: Au- tomated evaluation of retrieval augmented generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16604","last_updated":"2026-07-18T02:49:26Z","snapshot_observed_at":"2026-08-15T19:33:50.667669Z","submitted_at":"2026-07-18T02:49:26Z","title":"When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T20:32:17.311439Z"},"links":{"citing_paper":"/paper/2607.16604"},"observation_digest":"sha256:a791a7029056aeba581b224dea0646926c821a7e719c716ca97b0e5bd0a03362","observation_id":"404be34c-1306-4259-842e-15b540679c4c","resolution":{"observed_at":"2026-08-01T20:32:17.311439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:32:17.430209Z","title":"Learning transferable visual models from natural language supervi- sion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16604","last_updated":"2026-07-18T02:49:26Z","snapshot_observed_at":"2026-08-15T19:33:50.667669Z","submitted_at":"2026-07-18T02:49:26Z","title":"When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T20:32:17.430209Z"},"links":{"citing_paper":"/paper/2607.16604"},"observation_digest":"sha256:b8220a4afa5e9d318107c8f5b574cfe3375f6d282c361257c3668d7525b4be37","observation_id":"eb8ed7eb-211c-4d71-b00d-e290c0d85bb7","resolution":{"observed_at":"2026-08-01T20:32:17.430209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:32:17.554305Z","title":"Exploring network structure, dynamics, and function using NetworkX,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.16604","last_updated":"2026-07-18T02:49:26Z","snapshot_observed_at":"2026-08-15T19:33:50.667669Z","submitted_at":"2026-07-18T02:49:26Z","title":"When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T20:32:17.554305Z"},"links":{"citing_paper":"/paper/2607.16604"},"observation_digest":"sha256:c1d056106a01b335d2e5ca7d33cb99b233d290ba9c3bef17196c7cae3aed4be5","observation_id":"5be24bd1-9b21-478b-9344-169cc01c42d1","resolution":{"observed_at":"2026-08-01T20:32:17.554305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-01T20:32:17.719928Z","title":"GPT-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16604","last_updated":"2026-07-18T02:49:26Z","snapshot_observed_at":"2026-08-15T19:33:50.667669Z","submitted_at":"2026-07-18T02:49:26Z","title":"When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T20:32:17.719928Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.16604"},"observation_digest":"sha256:4dd21d8ec2ddcd87f8b68c3eb2f563cc6b01632b538cd316c9fcb20069110666","observation_id":"624cf77c-f692-4444-99b6-2579d894742d","resolution":{"observed_at":"2026-08-01T20:32:17.719928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-01T20:32:17.861687Z","title":"Gemini: A family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16604","last_updated":"2026-07-18T02:49:26Z","snapshot_observed_at":"2026-08-15T19:33:50.667669Z","submitted_at":"2026-07-18T02:49:26Z","title":"When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T20:32:17.861687Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.16604"},"observation_digest":"sha256:9450bf8f5f50632a5a3874d1dff2cddbc6625d1ff1a5b9cdac15c48fa64c4ec2","observation_id":"909d2372-3f05-42b9-959b-12b4f5a02110","resolution":{"observed_at":"2026-08-01T20:32:17.861687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:32:17.930733Z","title":"The llama 4 herd: The beginning of a new era of natively multimodal ai innovation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16604","last_updated":"2026-07-18T02:49:26Z","snapshot_observed_at":"2026-08-15T19:33:50.667669Z","submitted_at":"2026-07-18T02:49:26Z","title":"When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T20:32:17.930733Z"},"links":{"citing_paper":"/paper/2607.16604"},"observation_digest":"sha256:38c73271a409786e0ca8068f6835a35b0c91d4fa25cc450096779e6f9b0415e8","observation_id":"bf9a9633-d9c6-4992-ac86-61c4437cf19e","resolution":{"observed_at":"2026-08-01T20:32:17.930733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:32:18.012147Z","title":"Llama 4 Scout 17B 16E Instruct model card,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16604","last_updated":"2026-07-18T02:49:26Z","snapshot_observed_at":"2026-08-15T19:33:50.667669Z","submitted_at":"2026-07-18T02:49:26Z","title":"When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T20:32:18.012147Z"},"links":{"citing_paper":"/paper/2607.16604"},"observation_digest":"sha256:ad45ccb7236d815fbb7e4c736bf5c860ea9087152191073927315c17b46b1d54","observation_id":"57c0fbe5-9473-4b98-a96d-02fdcbc34322","resolution":{"observed_at":"2026-08-01T20:32:18.012147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:32:18.160411Z","title":"Llama 4 Maverick 17B 128E Instruct FP8 model card,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16604","last_updated":"2026-07-18T02:49:26Z","snapshot_observed_at":"2026-08-15T19:33:50.667669Z","submitted_at":"2026-07-18T02:49:26Z","title":"When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T20:32:18.160411Z"},"links":{"citing_paper":"/paper/2607.16604"},"observation_digest":"sha256:9db038148abddb6f7b0bd51d9c84e3681ca328d35ca55cd99f74209347d47a2b","observation_id":"3ee55f96-babc-4f2b-be52-48b64d90d6a6","resolution":{"observed_at":"2026-08-01T20:32:18.160411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:32:18.234692Z","title":"small-publaynet-wds,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16604","last_updated":"2026-07-18T02:49:26Z","snapshot_observed_at":"2026-08-15T19:33:50.667669Z","submitted_at":"2026-07-18T02:49:26Z","title":"When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T20:32:18.234692Z"},"links":{"citing_paper":"/paper/2607.16604"},"observation_digest":"sha256:b42441825de982fbaa1e9f0e9e1be6fda792d23d43f98a40e095858b9f993884","observation_id":"af91b799-d97e-4683-b29c-3868a71553bc","resolution":{"observed_at":"2026-08-01T20:32:18.234692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:32:18.307058Z","title":"New embedding models and api updates,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16604","last_updated":"2026-07-18T02:49:26Z","snapshot_observed_at":"2026-08-15T19:33:50.667669Z","submitted_at":"2026-07-18T02:49:26Z","title":"When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T20:32:18.307058Z"},"links":{"citing_paper":"/paper/2607.16604"},"observation_digest":"sha256:0bb4c3cd73f39989381f450f81b6b2053a15503c95a551cede98e7b9283ee765","observation_id":"5eeaa352-7929-4222-add8-fc5430cbbd2a","resolution":{"observed_at":"2026-08-01T20:32:18.307058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:32:18.430312Z","title":"Billion-scale similarity search with GPUs,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16604","last_updated":"2026-07-18T02:49:26Z","snapshot_observed_at":"2026-08-15T19:33:50.667669Z","submitted_at":"2026-07-18T02:49:26Z","title":"When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T20:32:18.430312Z"},"links":{"citing_paper":"/paper/2607.16604"},"observation_digest":"sha256:1594bcf52001e26cdebee201913460a7059a2056df3a6bbbe8c771fe16f1de66","observation_id":"48c29ff7-5178-45d8-acc6-b89a510fde9f","resolution":{"observed_at":"2026-08-01T20:32:18.430312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T20:32:18.470918Z","title":"GPT-4o mini: Advancing cost-efficient intelligence,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16604","last_updated":"2026-07-18T02:49:26Z","snapshot_observed_at":"2026-08-15T19:33:50.667669Z","submitted_at":"2026-07-18T02:49:26Z","title":"When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T20:32:18.470918Z"},"links":{"citing_paper":"/paper/2607.16604"},"observation_digest":"sha256:6624a001d814d0db6843d15f49d31c78db02e3bb9c659f32111fd66aff19d2bf","observation_id":"7515ff62-6b24-47d0-bf3f-ff1eb4864bff","resolution":{"observed_at":"2026-08-01T20:32:18.470918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16604","last_updated":"2026-07-18T02:49:26Z","latest_version":1,"primary_category":"eess.IV","snapshot_observed_at":"2026-08-15T19:33:50.667669Z","submitted_at":"2026-07-18T02:49:26Z","title":"When Do Multimodal and Graph-Augmented RAG Help? A Controlled Evaluation for Document Question Answering"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2607.16604."}