{"as_of":"2026-08-09T04:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0db3eafbd832026c06f14d66523aaa8353a8449a16eb3adebee95b9c8f9116e1","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T20:28:58.667157Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T10:43:50.289411Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T07:44:22.118843Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09731","snapshot_observed_at":"2026-08-03T10:43:50.289411Z","title":"Bench- marking vision-language models on chinese ancient documents: From ocr to knowledge reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.09118","last_updated":"2026-07-16T14:44:01Z","snapshot_observed_at":"2026-08-08T18:45:43.759614Z","submitted_at":"2026-01-14T03:35:09Z","title":"LPCAN: Lightweight Pyramid Cross-Attention Network for Rail Surface Defect Detection Using RGB-D Data","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T10:43:50.289411Z"},"links":{"cited_paper":"/paper/2509.09731","citing_paper":"/paper/2601.09118"},"observation_digest":"sha256:becedea0b5dc483c672fcc99d143a2c659d03f981f5d7c25dc917997c4a19bd8","observation_id":"c9610636-bfdd-465c-899e-ffaf66302045","resolution":{"observed_at":"2026-08-03T10:43:50.289411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09731","snapshot_observed_at":"2026-08-03T10:43:42.247993Z","title":"Benchmarking vision-language models on chinese ancient documents: From ocr to knowledge reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.09238","last_updated":"2026-07-16T14:45:17Z","snapshot_observed_at":"2026-08-07T05:38:49.409741Z","submitted_at":"2026-01-14T07:21:57Z","title":"Knowledge-Embedded and Hypernetwork-Guided Few-Shot Substation Meter Defect Image Generation Method","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T10:43:42.247993Z"},"links":{"cited_paper":"/paper/2509.09731","citing_paper":"/paper/2601.09238"},"observation_digest":"sha256:2e66478904dbc11b6a3f9ce45cc307a8bc59d31bbceb23a24651071b5beb8415","observation_id":"21d2f413-1c2c-4719-80dc-18887a1dfc29","resolution":{"observed_at":"2026-08-03T10:43:42.247993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"cited_work":{"arxiv_id":"2509.09731","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09731","snapshot_observed_at":"2026-06-30T07:44:22.118843Z","title":"Benchmark- ing vision-language models on chinese ancient documents: From OCR to knowledge reasoning","venue":null,"work_id":"f36fe3f3-67ad-4157-9552-6ec0e160101b","year":2025},"citing_paper":{"arxiv_id":"2603.18472","last_updated":"2026-04-09T02:35:56Z","snapshot_observed_at":"2026-07-06T22:49:37.944352Z","submitted_at":"2026-03-19T04:08:20Z","title":"Cognitive Mismatch in Multimodal Large Language Models for Discrete Symbol Understanding","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-15T09:11:31.870441Z"},"links":{"cited_paper":"/paper/2509.09731","citing_paper":"/paper/2603.18472"},"observation_digest":"sha256:6c58860198b202e778b53f3f4e9eb3db96216bed2e4a91e69fd0749b79694e70","observation_id":"ef8ec59e-2475-4d72-9873-5ec42160fd27","resolution":{"observed_at":"2026-05-15T09:15:21.120295Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"cited_work":{"arxiv_id":"2509.09731","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09731","snapshot_observed_at":"2026-06-30T07:44:22.118843Z","title":"Benchmark- ing vision-language models on chinese ancient documents: From OCR to knowledge reasoning","venue":null,"work_id":"f36fe3f3-67ad-4157-9552-6ec0e160101b","year":2025},"citing_paper":{"arxiv_id":"2604.03339","last_updated":"2026-04-03T07:59:26Z","snapshot_observed_at":"2026-07-06T22:52:34.609783Z","submitted_at":"2026-04-03T07:59:26Z","title":"Hierarchical Awareness Adapters with Hybrid Pyramid Feature Fusion for Dense Depth Prediction","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-13T20:01:57.029143Z"},"links":{"cited_paper":"/paper/2509.09731","citing_paper":"/paper/2604.03339"},"observation_digest":"sha256:afa132f812c17884644f204b634efbdec2a145871039a7c47d2e803b0229098b","observation_id":"cbb588df-907a-4b40-b2b3-94f4a0190531","resolution":{"observed_at":"2026-05-13T20:03:12.218516Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"cited_work":{"arxiv_id":"2509.09731","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09731","snapshot_observed_at":"2026-06-30T07:44:22.118843Z","title":"Benchmark- ing vision-language models on chinese ancient documents: From OCR to knowledge reasoning","venue":null,"work_id":"f36fe3f3-67ad-4157-9552-6ec0e160101b","year":2025},"citing_paper":{"arxiv_id":"2605.18173","last_updated":"2026-05-18T10:15:57Z","snapshot_observed_at":"2026-08-02T16:11:51.976692Z","submitted_at":"2026-05-18T10:15:57Z","title":"Do You Need Text Rectification? Soft Attention Mask Embedding for Rectification-Free Scene Text Spotting","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T11:28:51.711892Z"},"links":{"cited_paper":"/paper/2509.09731","citing_paper":"/paper/2605.18173"},"observation_digest":"sha256:7f46cc1343492e4066923e7fb2b308910ad421e598ceb04e101e51e5bed3b035","observation_id":"2e45042a-e34d-459a-a9c2-1c5fa0724e2a","resolution":{"observed_at":"2026-05-20T11:33:14.587866Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"cited_work":{"arxiv_id":"2509.09731","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09731","snapshot_observed_at":"2026-06-30T07:44:22.118843Z","title":"Benchmark- ing vision-language models on chinese ancient documents: From OCR to knowledge reasoning","venue":null,"work_id":"f36fe3f3-67ad-4157-9552-6ec0e160101b","year":2025},"citing_paper":{"arxiv_id":"2606.29378","last_updated":"2026-06-28T13:01:54Z","snapshot_observed_at":"2026-08-06T08:18:12.503891Z","submitted_at":"2026-06-28T13:01:54Z","title":"Cross-Temporal Sinhala OCR: Page-Level Adaptation and Diachronic Analysis","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T07:37:05.806389Z"},"links":{"cited_paper":"/paper/2509.09731","citing_paper":"/paper/2606.29378"},"observation_digest":"sha256:769af8c5a429008b9d2d788e9a4c9a35edf287a683f2789fef0a9eb24d54b105","observation_id":"9712d40b-4612-4798-8402-1b1288ccb31d","resolution":{"observed_at":"2026-06-30T07:44:22.120541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09731","snapshot_observed_at":"2026-07-11T21:21:23.781984Z","title":"arXiv preprint arXiv:2509.09731 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04147","last_updated":"2026-07-05T07:15:17Z","snapshot_observed_at":"2026-08-09T03:20:52.573749Z","submitted_at":"2026-07-05T07:15:17Z","title":"HCSU: A Dataset and Benchmark for Fine-Grained Historical Calligraphy Style Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T21:21:23.781984Z"},"links":{"cited_paper":"/paper/2509.09731","citing_paper":"/paper/2607.04147"},"observation_digest":"sha256:b69f0b03c44c8d2e7aa6ad9298cffeac22fd3b5f3af2394d7abcb4412d8a119b","observation_id":"83074fb5-d41f-4cdf-9a24-a1817977b1fe","resolution":{"observed_at":"2026-07-11T21:21:23.781984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.09731/citation-record","integrity":"/paper/2509.09731/integrity","json":"/paper/2509.09731/citation-record.json","paper":"/paper/2509.09731"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:55.488191Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:55.488191Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:63d70dc720418e995dcf6a9bf4581f94bf29681c317f21d907d65108b2a879d9","observation_id":"f05893e5-57e7-48f1-94d7-59d5ba16ed80","resolution":{"observed_at":"2026-08-04T20:28:55.488191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:55.595187Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:55.595187Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:d665a18f4372c012a9d6822d3c7d853e803df56c904455c4e81743708c10588f","observation_id":"9c830c9c-e00f-480a-aa2f-9052dcf7e671","resolution":{"observed_at":"2026-08-04T20:28:55.595187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:55.684666Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:55.684666Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:222fecdb96519050fb25713ea4760466ff885f958e6100a3bb72f5beb229ab6d","observation_id":"911156ce-463a-4dba-bc3f-d66365587edb","resolution":{"observed_at":"2026-08-04T20:28:55.684666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-04T20:28:55.790100Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:55.790100Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:e63acf7f8babd52fe29c6a2557ebe227f4a1c56e613ce882f9208136fe4ec464","observation_id":"2e3ce02e-f44c-4212-b5a4-927873b0f9a2","resolution":{"observed_at":"2026-08-04T20:28:55.790100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T20:28:55.948935Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:55.948935Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:9c64ba4139f092cc586e70cb7f7b81f6d8932b7830e6ec99476a32ec17f29378","observation_id":"e85b5855-540f-4cbd-ad86-e59174dcc118","resolution":{"observed_at":"2026-08-04T20:28:55.948935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:56.073670Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:56.073670Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:2c80e4f71fd4b9672083013a7e91eaeee9874b1f98b21136a28e50510a9d706c","observation_id":"6834c168-d5bc-4d4f-bfcf-8ac73ba9974d","resolution":{"observed_at":"2026-08-04T20:28:56.073670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-04T20:28:56.209162Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:56.209162Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:efe0a6ccb6bafe69431fab5a40e8902b68305319f0a25f11715b3778baa54f84","observation_id":"ecce6003-8a7a-455a-aa1b-4041f0ba2e20","resolution":{"observed_at":"2026-08-04T20:28:56.209162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-04T20:28:56.327267Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:56.327267Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:8d51dc929860bee425b29d0d6c890ec90b3739069f94987d4efc1e666f3bdcfb","observation_id":"7d5ee3e1-6496-4354-9378-596ae27ace96","resolution":{"observed_at":"2026-08-04T20:28:56.327267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:56.531953Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:56.531953Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:50e7f64e9f4535c271fecb47dbf01e1f0bb66baa0c6cc0f0503aec7137c2113a","observation_id":"ce9c5351-e408-496c-9530-fecc5e903803","resolution":{"observed_at":"2026-08-04T20:28:56.531953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:56.669105Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:56.669105Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:a2138dced4abc7b07be4759150278a86c2410c16e18a2a7a8e5756a683979a60","observation_id":"68bcb4c3-60dc-4df5-8581-fb6c5d484b7d","resolution":{"observed_at":"2026-08-04T20:28:56.669105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12720","last_updated":"2024-04-19T09:00:05Z","snapshot_observed_at":"2026-07-06T18:02:36.759308Z","submitted_at":"2024-04-19T09:00:05Z","title":"PDF-MVQA: A Dataset for Multimodal Information Retrieval in PDF-based Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12720","snapshot_observed_at":"2026-08-04T20:28:56.764648Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:56.764648Z"},"links":{"cited_paper":"/paper/2404.12720","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:d964f51928486e583acbeb7234c02186fe78355b70bfa906d61019177e25ba06","observation_id":"0f233e32-b037-4401-a55e-61e8655d5b7d","resolution":{"observed_at":"2026-08-04T20:28:56.764648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-07T17:13:10.057242Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-04T20:28:56.875999Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:56.875999Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:12e7f2d5ed4d059be3c9b2932672a3ae89eadc46aaa5c81963eeae6cfc4e96ac","observation_id":"84b965d6-31f2-41d0-8c12-0fd77429e975","resolution":{"observed_at":"2026-08-04T20:28:56.875999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:56.997145Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:56.997145Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:67256624779d2f6482a44e2136982e7092d62c7312fd35daf71c1514a9a0e68f","observation_id":"ba7ee8dd-4604-4a9c-98d6-3baa29446f36","resolution":{"observed_at":"2026-08-04T20:28:56.997145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:57.072509Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:57.072509Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:c4ced86748702ae3f9d695896c9829a33371484b5abcfa599dc81d69b8adfff3","observation_id":"dc4c2ace-bcc7-4d7e-bfab-26327dd3bb54","resolution":{"observed_at":"2026-08-04T20:28:57.072509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-04T20:28:57.160446Z","title":"P.; Perelman, A.; Ramesh, A.; Clark, A.; Ostrow, A.; Welihinda, A.; Hayes, A.; Radford, A.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:57.160446Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:23622f3ccbc018715e6c6a48d308c792d1fb8d19cff916ce3ecd2b4e56cdd8b8","observation_id":"42173e17-e42e-42e5-b848-cb63742da6a0","resolution":{"observed_at":"2026-08-04T20:28:57.160446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:57.312037Z","title":"R.; Fujii, Y.; Deselaers, T.; Baccash, J.; and Popat, A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:57.312037Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:7d20f832b3b8b48727812bc96af0a2758fd4378e70b9b20bba2f45be0abc85ad","observation_id":"b5f7687b-1782-48cb-9d62-ba4b4368a11a","resolution":{"observed_at":"2026-08-04T20:28:57.312037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:57.424293Z","title":"K.; and Thiran, J.-P","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:57.424293Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:e4129cf38ef48b920d730f4ab40b0beb2f14c8021b23473d09d2d76bc2e05647","observation_id":"d8a52f64-a8c7-4f46-957b-134fb5139a23","resolution":{"observed_at":"2026-08-04T20:28:57.424293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:57.529652Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:57.529652Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:cd76a7f82d66aff6febd984711e3d725745244e785c4580285592a762b8c380d","observation_id":"557e4200-db46-4c2c-9ca7-ecdaffba2050","resolution":{"observed_at":"2026-08-04T20:28:57.529652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:57.596554Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:57.596554Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:66025207fff230d85f54690d68563e81931af12f3c6eb79166a78967986256fe","observation_id":"e9721f0c-8083-44ed-9efa-6785e0f783e6","resolution":{"observed_at":"2026-08-04T20:28:57.596554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-04T20:28:57.652002Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:57.652002Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:c5f583d073eb54c9ad65b899c4e9a3cc76925784ae2e15d77406301aa93a7aa0","observation_id":"2dea98c2-cd7f-40d1-a31d-8ab4466ca338","resolution":{"observed_at":"2026-08-04T20:28:57.652002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:57.683646Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:57.683646Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:9722ed83c79fd6fea16da4318c2ab713592eeca0328d97dfd3924b80aba09893","observation_id":"e238eea3-6f32-4f64-bf99-eb5048bc4d12","resolution":{"observed_at":"2026-08-04T20:28:57.683646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:57.710848Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:57.710848Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:f66ccb018a967552d9c2cc8d48144e66eb6274184ebe931b2205c08a4c43e753","observation_id":"afc78959-9777-4895-b889-565758f6bf31","resolution":{"observed_at":"2026-08-04T20:28:57.710848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:57.813522Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:57.813522Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:73e3479d2ab4c088b16122a2c9d94994f70e7e065515381ca53855769bf53d83","observation_id":"6313de6a-6945-4398-91eb-2c5e59d25685","resolution":{"observed_at":"2026-08-04T20:28:57.813522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:57.959749Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:57.959749Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:61cb6a8b571ce45283b8e60b607979ad109c31329e142f11dea8b5025df0fa99","observation_id":"444421fb-3811-4a36-9131-5a4d9e8f1d4d","resolution":{"observed_at":"2026-08-04T20:28:57.959749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:58.058222Z","title":"K.; and Chakraborty, A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.058222Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:d4f96419a682fcce6fe816616a91f405831b0f77420550a9757173109291fd5d","observation_id":"923980f4-301f-4b64-a468-19ced63e1a27","resolution":{"observed_at":"2026-08-04T20:28:58.058222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:58.157387Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.157387Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:125c93585b488bb7525aa353e532129e72f122f3ea48fa9d4f6b2e8792a26e74","observation_id":"b4a61e2b-1906-41e8-bd58-0084f410b66e","resolution":{"observed_at":"2026-08-04T20:28:58.157387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-04T20:28:58.325357Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.325357Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:cadb3d574e8c79d33a88d32845697fabce941b5940e56924dc7f4db337e05506","observation_id":"5c05b445-3443-469b-9358-f8e16c6f8c64","resolution":{"observed_at":"2026-08-04T20:28:58.325357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:58.539509Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.539509Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:8c191a06cdda2eea993b40fb2e09690a3e13d0277c71f95a06e9c9f9d47f47e9","observation_id":"0f80da44-369f-4492-8a0a-4290147fa0e3","resolution":{"observed_at":"2026-08-04T20:28:58.539509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-04T20:28:58.597765Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.597765Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:71650e69c8d5327be5cceac69b854b096236d00ca47b870753e8028fbb612cfa","observation_id":"9ae68a05-9103-4eaf-8053-81e0dc4ad9bc","resolution":{"observed_at":"2026-08-04T20:28:58.597765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:58.618224Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.618224Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:fa23ee897a10ae8f23713d94d3537aa926ebe2023217942085860fec1faa2fa7","observation_id":"91e7c22a-d528-4915-896f-12537a872ee0","resolution":{"observed_at":"2026-08-04T20:28:58.618224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02210","last_updated":"2023-10-24T14:00:21Z","snapshot_observed_at":"2026-07-06T15:12:22.395669Z","submitted_at":"2023-04-05T03:49:06Z","title":"Document-Level Machine Translation with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02210","snapshot_observed_at":"2026-08-04T20:28:58.622466Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.622466Z"},"links":{"cited_paper":"/paper/2304.02210","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:59e02226472d4e3519f2e218bd8912b323aef0b93abcd36947b108d6b6c68214","observation_id":"2f82990a-7b0e-4f6f-9248-e855639de8e4","resolution":{"observed_at":"2026-08-04T20:28:58.622466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-04T20:28:58.627438Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.627438Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:5627871002ad39694587931441bee47a173e8e0ddcc987f6f942d1f4d0ab5ef2","observation_id":"b0370a9e-7487-4a8c-95a0-23490b382d37","resolution":{"observed_at":"2026-08-04T20:28:58.627438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-04T20:28:58.632055Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.632055Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:3ae2223220205d96d19f8151c80993ce7444745704de25db7450f78606e1e742","observation_id":"dc243383-6c26-4150-adad-655e754655e4","resolution":{"observed_at":"2026-08-04T20:28:58.632055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:58.636639Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.636639Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:5646733848eeddb74474e36b3a997464df7095f0577d0755e9a17bef282cb635","observation_id":"39b8b67e-0687-4bd8-bcbb-e42f47b4ee30","resolution":{"observed_at":"2026-08-04T20:28:58.636639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:58.640806Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.640806Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:9843b9031629d2938ec7ede184c87749cd7a43ec90fd3132408a09b672b2f9a5","observation_id":"feb55710-8259-4352-a362-ac138cbf8833","resolution":{"observed_at":"2026-08-04T20:28:58.640806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.01727","last_updated":"2017-09-06T09:01:53Z","snapshot_observed_at":"2026-07-06T05:58:19.597227Z","submitted_at":"2017-09-06T09:01:53Z","title":"Scene Text Recognition with Sliding Convolutional Character Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.01727","snapshot_observed_at":"2026-08-04T20:28:58.645516Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.645516Z"},"links":{"cited_paper":"/paper/1709.01727","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:a7015878fc37c07e7aeb894e1f51edf8e9ba10e4789499160db125c04363636e","observation_id":"ec2d7cb7-7569-40e7-8bc1-a9848774673e","resolution":{"observed_at":"2026-08-04T20:28:58.645516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.03581","last_updated":"2018-10-08T17:09:10Z","snapshot_observed_at":"2026-07-06T07:06:44.377189Z","submitted_at":"2018-10-08T17:09:10Z","title":"Improving the Transformer Translation Model with Document-Level Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.03581","snapshot_observed_at":"2026-08-04T20:28:58.650005Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.650005Z"},"links":{"cited_paper":"/paper/1810.03581","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:647b82ed20740e05efd4675b7e407bc2db32ce057dcfa919781276d94acd1c56","observation_id":"66b223fc-2b55-4828-9264-a360d38b7796","resolution":{"observed_at":"2026-08-04T20:28:58.650005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:58.654420Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.654420Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:c74d900ac2fe58ba90a5d3a88def75318bfd203b1dd7a875910dc4e66760f80d","observation_id":"57cf7a75-b14d-410c-b564-3b60a47697cc","resolution":{"observed_at":"2026-08-04T20:28:58.654420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-04T20:28:58.658554Z","title":"Q.; and Artzi, Y","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.658554Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:267a74d3090e2c8fec03131a16d5295fde193b700bca0a4b01630a3ae0f2108d","observation_id":"d9796f94-fb58-4486-ac5f-04c0ca76b3ba","resolution":{"observed_at":"2026-08-04T20:28:58.658554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:28:58.663051Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.663051Z"},"links":{"citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:67cec75e83e5dbc8c4e8326cc8eb7ce1e988686d4ad559d536c83d31a098cfab","observation_id":"2ba5b515-1068-40d9-bb03-eff27398cdb4","resolution":{"observed_at":"2026-08-04T20:28:58.663051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-04T20:28:58.667157Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.667157Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:9b7dbf163983260eb38043875a259e316cba2a5e45f02799d5b22f82b1819e7b","observation_id":"c59d43ff-edc1-49a5-93b1-705d9c032d02","resolution":{"observed_at":"2026-08-04T20:28:58.667157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-04T20:28:42.834716Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 7 inbound Pith citation observations for arXiv:2509.09731."}