{"as_of":"2026-08-05T22:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e8d44e09b22509440409df6c9f83b53750e1dd4bfcdc1a9c38e9a40e5180c9cd","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T22:06:14.726012Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T22:06:12.301504Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-04T22:06:14.962988Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.07538","last_updated":"2025-09-10T09:41:48Z","snapshot_observed_at":"2026-08-04T22:06:11.795238Z","submitted_at":"2025-09-09T09:16:25Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","version":2},"cited_work":{"arxiv_id":"2509.07538","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.07538","snapshot_observed_at":"2026-08-04T22:06:14.962988Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","venue":"cs.CV","work_id":"b8c564f8-492a-40ef-8674-41d18f7bc46f","year":2025},"citing_paper":{"arxiv_id":"2509.07538","last_updated":"2025-09-10T09:41:48Z","snapshot_observed_at":"2026-08-04T22:06:11.795238Z","submitted_at":"2025-09-09T09:16:25Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T22:06:12.301504Z"},"links":{"cited_paper":"/paper/2509.07538","citing_paper":"/paper/2509.07538"},"observation_digest":"sha256:ec0bc09b25b873d1302e7d7ea85e49a899d7cd847a3969113929cadf5c12a3f4","observation_id":"606b6d8b-d461-4960-af5b-173171b3b925","resolution":{"observed_at":"2026-08-04T22:06:15.028832Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.07538/citation-record","integrity":"/paper/2509.07538/integrity","json":"/paper/2509.07538/citation-record.json","paper":"/paper/2509.07538"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.07538","last_updated":"2025-09-10T09:41:48Z","snapshot_observed_at":"2026-08-04T22:06:11.795238Z","submitted_at":"2025-09-09T09:16:25Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","version":2},"cited_work":{"arxiv_id":"2509.07538","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.07538","snapshot_observed_at":"2026-08-04T22:06:14.962988Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","venue":"cs.CV","work_id":"b8c564f8-492a-40ef-8674-41d18f7bc46f","year":2025},"citing_paper":{"arxiv_id":"2509.07538","last_updated":"2025-09-10T09:41:48Z","snapshot_observed_at":"2026-08-04T22:06:11.795238Z","submitted_at":"2025-09-09T09:16:25Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T22:06:12.301504Z"},"links":{"cited_paper":"/paper/2509.07538","citing_paper":"/paper/2509.07538"},"observation_digest":"sha256:ec0bc09b25b873d1302e7d7ea85e49a899d7cd847a3969113929cadf5c12a3f4","observation_id":"606b6d8b-d461-4960-af5b-173171b3b925","resolution":{"observed_at":"2026-08-04T22:06:15.028832Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:06:17.623618Z","title":null,"venue":null,"work_id":"ccaa4a4f-0941-41bb-bed0-23921dd86811","year":null},"citing_paper":{"arxiv_id":"2509.07538","last_updated":"2025-09-10T09:41:48Z","snapshot_observed_at":"2026-08-04T22:06:11.795238Z","submitted_at":"2025-09-09T09:16:25Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T22:06:12.385386Z"},"links":{"citing_paper":"/paper/2509.07538"},"observation_digest":"sha256:1a209b0630a51b1f9d142bef996b6d673cb31cb9a4ec16bcc3f68a3fad1507dd","observation_id":"600a6e06-3e4b-4834-b9ad-dbfe3a638a6e","resolution":{"observed_at":"2026-08-04T22:06:17.673515Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:06:17.504631Z","title":"QA” and “Pool","venue":null,"work_id":"d76262b7-decd-4479-8fc0-a3a34ae5cb00","year":null},"citing_paper":{"arxiv_id":"2509.07538","last_updated":"2025-09-10T09:41:48Z","snapshot_observed_at":"2026-08-04T22:06:11.795238Z","submitted_at":"2025-09-09T09:16:25Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T22:06:12.476150Z"},"links":{"citing_paper":"/paper/2509.07538"},"observation_digest":"sha256:dd83481fd46bc798783cca05f575433d14d2157579f3592e554b9ca083e9e788","observation_id":"47eab786-962c-4950-91ee-8c1849fab26a","resolution":{"observed_at":"2026-08-04T22:06:17.545134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:06:17.412594Z","title":"T”, “I”, and “A","venue":null,"work_id":"1b9ca9fc-ce67-4959-8af4-d9dd6a19c4be","year":null},"citing_paper":{"arxiv_id":"2509.07538","last_updated":"2025-09-10T09:41:48Z","snapshot_observed_at":"2026-08-04T22:06:11.795238Z","submitted_at":"2025-09-09T09:16:25Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T22:06:12.554832Z"},"links":{"citing_paper":"/paper/2509.07538"},"observation_digest":"sha256:5c512a8db1a2961f962edba40b970b2367e275448220a207c01cc41675f46a43","observation_id":"1bacaeaf-5a0f-4afa-abb0-3abaca15851a","resolution":{"observed_at":"2026-08-04T22:06:17.451643Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:06:17.277923Z","title":"We also introduce the first bilingual bench- mark for this task and release the first open-source Chinese visual document RAG dataset","venue":null,"work_id":"7f4962bd-006a-453e-a60b-d8e01321cace","year":null},"citing_paper":{"arxiv_id":"2509.07538","last_updated":"2025-09-10T09:41:48Z","snapshot_observed_at":"2026-08-04T22:06:11.795238Z","submitted_at":"2025-09-09T09:16:25Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T22:06:12.640657Z"},"links":{"citing_paper":"/paper/2509.07538"},"observation_digest":"sha256:099bf15845c3daaba3a32d2598b4702e7908f74325dafd26d92111f3baadbbcb","observation_id":"3440a9c0-d2b6-40a1-a534-d80f8976fdb2","resolution":{"observed_at":"2026-08-04T22:06:17.317046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T22:06:12.726138Z","title":"Qwen2.5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07538","last_updated":"2025-09-10T09:41:48Z","snapshot_observed_at":"2026-08-04T22:06:11.795238Z","submitted_at":"2025-09-09T09:16:25Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T22:06:12.726138Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.07538"},"observation_digest":"sha256:5e4e1fc5dc93aeb6b8f9b148fa56b6827fd550843d33f7466f9033158756b510","observation_id":"1423b882-83c0-40a3-8715-4419875f8612","resolution":{"observed_at":"2026-08-04T22:06:12.726138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-04T22:06:12.859876Z","title":"Qwen2-vl: Enhancing vision-language model’s per- ception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07538","last_updated":"2025-09-10T09:41:48Z","snapshot_observed_at":"2026-08-04T22:06:11.795238Z","submitted_at":"2025-09-09T09:16:25Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T22:06:12.859876Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2509.07538"},"observation_digest":"sha256:149cc64ae8539564cdc693f4d1d6a974590e66c19501fa71e5e03250d5cae134","observation_id":"0f0f9cdd-5cb6-45df-a3b4-b80af33a98cd","resolution":{"observed_at":"2026-08-04T22:06:12.859876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:06:17.169951Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models,","venue":null,"work_id":"cba65aff-e70f-46af-8f2d-469a662a7fea","year":2025},"citing_paper":{"arxiv_id":"2509.07538","last_updated":"2025-09-10T09:41:48Z","snapshot_observed_at":"2026-08-04T22:06:11.795238Z","submitted_at":"2025-09-09T09:16:25Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T22:06:12.949476Z"},"links":{"citing_paper":"/paper/2509.07538"},"observation_digest":"sha256:e46b3d24633153542a152afd72e807146f6c1da3603ebd633d74d347fc91d48a","observation_id":"871b664e-c294-4bcb-b8d9-0f3f6e942b40","resolution":{"observed_at":"2026-08-04T22:06:17.214049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-03T04:23:51.274879Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-04T22:06:13.082058Z","title":"Qwen2.5-omni technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07538","last_updated":"2025-09-10T09:41:48Z","snapshot_observed_at":"2026-08-04T22:06:11.795238Z","submitted_at":"2025-09-09T09:16:25Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T22:06:13.082058Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2509.07538"},"observation_digest":"sha256:3fccba8693f49379f8c1d9079abe205fecbe67f395485475c18d84a1946a7d20","observation_id":"d34ea977-7fb2-4015-9f58-671224254057","resolution":{"observed_at":"2026-08-04T22:06:13.082058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:06:17.073176Z","title":"Multimodal large language models for text-rich image understanding: A comprehensive review,","venue":null,"work_id":"d6524586-05c3-4ce2-bb63-1053c8c3ce44","year":2025},"citing_paper":{"arxiv_id":"2509.07538","last_updated":"2025-09-10T09:41:48Z","snapshot_observed_at":"2026-08-04T22:06:11.795238Z","submitted_at":"2025-09-09T09:16:25Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T22:06:13.228865Z"},"links":{"citing_paper":"/paper/2509.07538"},"observation_digest":"sha256:2fc59094d368eae9311dca91082f2ac24d036d4eac5a2a2526d35bcf3d5ba6be","observation_id":"32547a26-8c4f-457a-99e8-5ac6ce85f793","resolution":{"observed_at":"2026-08-04T22:06:17.120494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:06:16.931407Z","title":"Mmlongbench-doc: Benchmarking long-context doc- ument understanding with visualizations,","venue":null,"work_id":"b9404cc7-80bc-4556-a64b-48ed07f759c5","year":2024},"citing_paper":{"arxiv_id":"2509.07538","last_updated":"2025-09-10T09:41:48Z","snapshot_observed_at":"2026-08-04T22:06:11.795238Z","submitted_at":"2025-09-09T09:16:25Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T22:06:13.373610Z"},"links":{"citing_paper":"/paper/2509.07538"},"observation_digest":"sha256:a28c5eece3a5dd59344891356aff4afb4e89c4ebd7f9a0934b4c9135be1209bc","observation_id":"95a827ec-44a4-4fe2-bbe2-090653ed6d23","resolution":{"observed_at":"2026-08-04T22:06:16.990451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:06:16.796012Z","title":"Slidevqa: A dataset for document visual question answering on multiple im- ages,","venue":null,"work_id":"e6b7e993-9a3b-412a-b5b3-f75f53719a76","year":2023},"citing_paper":{"arxiv_id":"2509.07538","last_updated":"2025-09-10T09:41:48Z","snapshot_observed_at":"2026-08-04T22:06:11.795238Z","submitted_at":"2025-09-09T09:16:25Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T22:06:13.458860Z"},"links":{"citing_paper":"/paper/2509.07538"},"observation_digest":"sha256:e8d5fc71ecd86f4a263da43b7c1d92bb0e57af42909c1a795a9f7c7c9ad3c1cf","observation_id":"562fc4ec-99ff-4236-b3c1-ac4a53790dd8","resolution":{"observed_at":"2026-08-04T22:06:16.851276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:06:16.696792Z","title":"Visrag: Vision-based retrieval-augmented gener- ation on multi-modality documents,","venue":null,"work_id":"d788ca68-5f93-4acb-b84b-6a5364a48eef","year":2025},"citing_paper":{"arxiv_id":"2509.07538","last_updated":"2025-09-10T09:41:48Z","snapshot_observed_at":"2026-08-04T22:06:11.795238Z","submitted_at":"2025-09-09T09:16:25Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T22:06:13.685022Z"},"links":{"citing_paper":"/paper/2509.07538"},"observation_digest":"sha256:9441040b8e8d88836e99ff113e7c3b9f2c51d5bbf8f9c5e7ec8fedfb98cd1fa8","observation_id":"480d65f9-44d7-4389-96f5-54c4f5ff02ee","resolution":{"observed_at":"2026-08-04T22:06:16.748304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:06:16.596394Z","title":"Vdocrag: Retrieval-augmented generation over visually-rich documents,","venue":null,"work_id":"590985fe-79a6-4c85-ab67-4ede30a7cfa1","year":2025},"citing_paper":{"arxiv_id":"2509.07538","last_updated":"2025-09-10T09:41:48Z","snapshot_observed_at":"2026-08-04T22:06:11.795238Z","submitted_at":"2025-09-09T09:16:25Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T22:06:13.763678Z"},"links":{"citing_paper":"/paper/2509.07538"},"observation_digest":"sha256:4f170673bc9636e56676a241d5191a5952f706f4659258724bfe04acc9a160bf","observation_id":"cf69189f-c193-4101-ac81-a1f6822cfb10","resolution":{"observed_at":"2026-08-04T22:06:16.643795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18017","last_updated":"2025-06-03T05:34:30Z","snapshot_observed_at":"2026-07-06T20:42:14.536063Z","submitted_at":"2025-02-25T09:26:12Z","title":"ViDoRAG: Visual Document Retrieval-Augmented Generation via Dynamic Iterative Reasoning Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18017","snapshot_observed_at":"2026-08-04T22:06:13.857070Z","title":"Vidorag: Visual document retrieval-augmented generation via dynamic iterative reasoning agents,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07538","last_updated":"2025-09-10T09:41:48Z","snapshot_observed_at":"2026-08-04T22:06:11.795238Z","submitted_at":"2025-09-09T09:16:25Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T22:06:13.857070Z"},"links":{"cited_paper":"/paper/2502.18017","citing_paper":"/paper/2509.07538"},"observation_digest":"sha256:e5a9498a1572c67037f3405b8f7a3433b9ed80d0c5fd9193295d595f3e49af61","observation_id":"7cbf5f85-c8b1-4fce-a48e-2d61d87c3c8c","resolution":{"observed_at":"2026-08-04T22:06:13.857070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:06:16.496235Z","title":"Towards multilingual spoken visual question answering system using cross-attention,","venue":null,"work_id":"bdec44da-0153-499c-97e5-866f6e4b0a12","year":2025},"citing_paper":{"arxiv_id":"2509.07538","last_updated":"2025-09-10T09:41:48Z","snapshot_observed_at":"2026-08-04T22:06:11.795238Z","submitted_at":"2025-09-09T09:16:25Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T22:06:13.956121Z"},"links":{"citing_paper":"/paper/2509.07538"},"observation_digest":"sha256:46130e24f1e12110f94889d8800113090bc91feb5693aeab12e467a251033b15","observation_id":"c36e5c04-4cf5-4a1e-b3f3-c55cc9e501dd","resolution":{"observed_at":"2026-08-04T22:06:16.545105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:06:16.367428Z","title":"Spoken question answering for visual queries,","venue":null,"work_id":"bc950816-c517-47a3-ac22-6cc8a22ac7f8","year":2025},"citing_paper":{"arxiv_id":"2509.07538","last_updated":"2025-09-10T09:41:48Z","snapshot_observed_at":"2026-08-04T22:06:11.795238Z","submitted_at":"2025-09-09T09:16:25Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T22:06:14.052491Z"},"links":{"citing_paper":"/paper/2509.07538"},"observation_digest":"sha256:5e2f55595eda38514e7c13c07f5fff052209ebfda3df63316c2b074289e6c03d","observation_id":"3629ed68-c9d4-4e57-899b-ccbee08d4cd5","resolution":{"observed_at":"2026-08-04T22:06:16.411574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:06:16.264523Z","title":"ChartQA: A benchmark for question answer- ing about charts with visual and logical reasoning,","venue":null,"work_id":"0a23367f-70de-444a-ab55-04a19ac868f9","year":2022},"citing_paper":{"arxiv_id":"2509.07538","last_updated":"2025-09-10T09:41:48Z","snapshot_observed_at":"2026-08-04T22:06:11.795238Z","submitted_at":"2025-09-09T09:16:25Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T22:06:14.163239Z"},"links":{"citing_paper":"/paper/2509.07538"},"observation_digest":"sha256:a701c35bb8350970298eb47652cffbdc6efe96bd7bedf74c0de19fd41920940b","observation_id":"7cd47da3-cd8c-4f36-9db2-675f04a48a10","resolution":{"observed_at":"2026-08-04T22:06:16.316678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:06:16.144803Z","title":"Infographicvqa,","venue":null,"work_id":"ff26dc47-5796-44f2-97aa-ad5fcc1a5d9b","year":2021},"citing_paper":{"arxiv_id":"2509.07538","last_updated":"2025-09-10T09:41:48Z","snapshot_observed_at":"2026-08-04T22:06:11.795238Z","submitted_at":"2025-09-09T09:16:25Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T22:06:14.279547Z"},"links":{"citing_paper":"/paper/2509.07538"},"observation_digest":"sha256:e21f5d11c687c6192d77a4940852fc605267989d720abaaff43953227bf8cc9f","observation_id":"643ea55e-f9f3-40c9-a69c-72a08ff89757","resolution":{"observed_at":"2026-08-04T22:06:16.186822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:06:16.015331Z","title":"ICDAR 2023 competition on document understanding of everything (dude),","venue":null,"work_id":"a0945f1a-451c-4ac3-9a16-af00246b8b2d","year":2023},"citing_paper":{"arxiv_id":"2509.07538","last_updated":"2025-09-10T09:41:48Z","snapshot_observed_at":"2026-08-04T22:06:11.795238Z","submitted_at":"2025-09-09T09:16:25Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T22:06:14.365990Z"},"links":{"citing_paper":"/paper/2509.07538"},"observation_digest":"sha256:7022878b83b39005a230c06d11119bdf279134165ad604a80c814aeb4ec04147","observation_id":"b53390ec-f5f9-4d6a-9ad6-698038c1d832","resolution":{"observed_at":"2026-08-04T22:06:16.083954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:06:15.879800Z","title":"The probabilistic relevance framework: Bm25 and beyond,","venue":null,"work_id":"f98c359b-e601-4d45-9b49-b08034a62ada","year":2009},"citing_paper":{"arxiv_id":"2509.07538","last_updated":"2025-09-10T09:41:48Z","snapshot_observed_at":"2026-08-04T22:06:11.795238Z","submitted_at":"2025-09-09T09:16:25Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T22:06:14.495250Z"},"links":{"citing_paper":"/paper/2509.07538"},"observation_digest":"sha256:1f38880b865a678423107931980e98f3d2a2c8da084e615ae8aa66b22b2c3c2d","observation_id":"451b199f-c2f9-4bf3-b9a5-4bffa7b36efa","resolution":{"observed_at":"2026-08-04T22:06:15.934745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:06:15.680119Z","title":"Text embeddings by weakly-supervised contrastive pre-training,","venue":null,"work_id":"983bc1ec-b95f-42ac-966d-982022619f66","year":2024},"citing_paper":{"arxiv_id":"2509.07538","last_updated":"2025-09-10T09:41:48Z","snapshot_observed_at":"2026-08-04T22:06:11.795238Z","submitted_at":"2025-09-09T09:16:25Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T22:06:14.561399Z"},"links":{"citing_paper":"/paper/2509.07538"},"observation_digest":"sha256:7d3aca312e2fb71786592016f1015ee91f26547499adf925e720350db9102a0b","observation_id":"4298f707-c53d-4f71-9f43-94128b5750ac","resolution":{"observed_at":"2026-08-04T22:06:15.783246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:06:15.469100Z","title":"Nv-embed: Improved tech- niques for training llms as generalist embedding mod- els,","venue":null,"work_id":"23558d53-44c0-4298-8e80-b52f6efa4621","year":2025},"citing_paper":{"arxiv_id":"2509.07538","last_updated":"2025-09-10T09:41:48Z","snapshot_observed_at":"2026-08-04T22:06:11.795238Z","submitted_at":"2025-09-09T09:16:25Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T22:06:14.635933Z"},"links":{"citing_paper":"/paper/2509.07538"},"observation_digest":"sha256:46fa01eaa5c1b9ab021e54f0db21d526488b811449f6dcf09424dab4ca08e715","observation_id":"61a5874e-f27b-4497-a356-f2e1dfdda83f","resolution":{"observed_at":"2026-08-04T22:06:15.560850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:06:15.307771Z","title":"Learning transferable vi- sual models from natural language supervision,","venue":null,"work_id":"88f09068-1e81-4953-b0ec-b41b0d458689","year":2021},"citing_paper":{"arxiv_id":"2509.07538","last_updated":"2025-09-10T09:41:48Z","snapshot_observed_at":"2026-08-04T22:06:11.795238Z","submitted_at":"2025-09-09T09:16:25Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T22:06:14.705712Z"},"links":{"citing_paper":"/paper/2509.07538"},"observation_digest":"sha256:95b5a3cfb6a07e79a8283de9972ec6b2d1dc2f7f34df81f4b7d41dcd23be4eb7","observation_id":"a17f529f-8511-49a9-9759-ce5e9170135b","resolution":{"observed_at":"2026-08-04T22:06:15.372478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:06:15.130009Z","title":"Uni- fying multimodal retrieval via document screenshot em- bedding,","venue":null,"work_id":"3be558c5-f2e6-4080-9834-abd9186dd264","year":2024},"citing_paper":{"arxiv_id":"2509.07538","last_updated":"2025-09-10T09:41:48Z","snapshot_observed_at":"2026-08-04T22:06:11.795238Z","submitted_at":"2025-09-09T09:16:25Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T22:06:14.726012Z"},"links":{"citing_paper":"/paper/2509.07538"},"observation_digest":"sha256:02ea8b1156a563b660e18a4bc589b5b2857b065d0536e6c2b35671f76d24dc60","observation_id":"79f12e5e-06ae-4220-b8e0-5c89fe9d0eca","resolution":{"observed_at":"2026-08-04T22:06:15.231025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.07538","last_updated":"2025-09-10T09:41:48Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T22:06:11.795238Z","submitted_at":"2025-09-09T09:16:25Z","title":"TextlessRAG: End-to-End Visual Document RAG by Speech Without Text"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 1 inbound Pith citation observation for arXiv:2509.07538."}