{"as_of":"2026-08-21T17:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c816196eea2821499e43886de887ef0b7f8eb9518d188340f8810120e476a73c","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T01:25:29.882104Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.14682/citation-record","integrity":"/paper/2607.14682/integrity","json":"/paper/2607.14682/citation-record.json","paper":"/paper/2607.14682"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T01:25:24.924803Z","title":"Qwen3-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:24.924803Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:8668597a450c2641a4ceea1be6785f37dc268d78750786b6cbe7d03cba66a77f","observation_id":"2036b856-62f4-4b1c-b5d2-dbe80dd4b4e7","resolution":{"observed_at":"2026-08-02T01:25:24.924803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:25.085350Z","title":"F., Tito, R., Mafla, A., Gomez, L., Rusinol, M., Valveny, E., Jawahar, C., and Karatzas, D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:25.085350Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:13d30563f4e38ff9f3afb77e71396ca9bf64cb0bd8ba1569acdf22cb1ba6f21a","observation_id":"4717a300-0a56-4541-b646-73bd9e992ac3","resolution":{"observed_at":"2026-08-02T01:25:25.085350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:25.697642Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:25.697642Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:3cad344f254be0262f4901f8628c63e130b687879e6fca26091f2bcd545aabd0","observation_id":"dc8c3ff4-281b-47bf-9fad-0f310a01fa16","resolution":{"observed_at":"2026-08-02T01:25:25.697642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:25.976663Z","title":"Boundingdocs: a unified dataset for document question answering with spatial annotations: S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:25.976663Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:c20c721084639a8607b296306b79f2429cae90060dd1cd8e3141711a0051a8df","observation_id":"c4adbef3-0997-4118-80b9-3fc3c9d87338","resolution":{"observed_at":"2026-08-02T01:25:25.976663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-20T11:47:17.477107Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-02T01:25:26.105226Z","title":"J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:26.105226Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:d171693bbdaec5bb13985d13cef32ec1c9cb526d2dd508fdcdd92f8c7641191e","observation_id":"c79a4934-3666-4184-a743-2ee99e67c107","resolution":{"observed_at":"2026-08-02T01:25:26.105226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:26.185055Z","title":"Layoutlmv3: Pre-training for document ai with unified text and image masking","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:26.185055Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:f4ef6c4c3d3d8af576512f0472a33c6a918abb77e6b8b0b4a311c9df2c046c0c","observation_id":"eaedfb15-ca91-479b-86df-4c3129ee7264","resolution":{"observed_at":"2026-08-02T01:25:26.185055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:26.305638Z","title":"B., and Zhang, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:26.305638Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:d57f59ff6878e2c22c6d5eb5a58ae46424f06c91b643fad6461819552297797c","observation_id":"b2a1eabf-7860-4adb-9005-28797899353c","resolution":{"observed_at":"2026-08-02T01:25:26.305638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:26.440656Z","title":"4v (ision) system card https://cdn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:26.440656Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:53cabbb36172bb470455504b67487efeaf9301c13c443032c67ae9d349e544ea","observation_id":"e01d50c8-b1d0-4f01-89d7-f736e4cbfdae","resolution":{"observed_at":"2026-08-02T01:25:26.440656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:26.589095Z","title":"Docile benchmark for document information localization and extraction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:26.589095Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:d11c113a3d642f1255bb81a7c8439e222ee50be0b7a94b84d75c08cff755107e","observation_id":"462196c9-676c-458e-bba1-3622dd6bb37c","resolution":{"observed_at":"2026-08-02T01:25:26.589095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:26.706633Z","title":"Unsloth: Fast fine-tuning and training of llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:26.706633Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:9be20eed023dd4ca78afbd6fc29dec162eccf57a14af958526c10849a11c7cde","observation_id":"f6494e40-5c51-44a8-8481-2c36e3883896","resolution":{"observed_at":"2026-08-02T01:25:26.706633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:26.737077Z","title":"A., Jung, K., J \\\"a lk \\\"o , J., D’Andecy, V","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:26.737077Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:688b157b5c531f742a537ed8ce44d2b87f425fbe6396562428dd78797659f2a8","observation_id":"f53706a9-e410-4714-acf3-b45d8c1c20d0","resolution":{"observed_at":"2026-08-02T01:25:26.737077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:26.773547Z","title":"Drishtikon: Multi-granular visual grounding for text-rich document images","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:26.773547Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:a88582f07eb613485cb6a4893220a2f8247548b44d5c5c8a172bb2d5cbde774b","observation_id":"73bcadbe-187f-4e07-97f5-e3da8ea9d093","resolution":{"observed_at":"2026-08-02T01:25:26.773547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:26.806212Z","title":"Towards visual grounding: A survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:26.806212Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:c20b36656f4271913b22158d4caee82fb13500b5b1e2f656920e941d19b8f6f5","observation_id":"2131c131-dfc1-4d60-a3d9-f6d9647d601b","resolution":{"observed_at":"2026-08-02T01:25:26.806212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:26.922461Z","title":"Docthinker: Explainable multimodal large language models with rule-based reinforcement learning for document understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:26.922461Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:f193ea2078ce1317329cd02b39a3164b04c852921e9bc09325cd096501cb3985","observation_id":"5c91b62c-ff95-4277-ba1e-b3c1c48aecd0","resolution":{"observed_at":"2026-08-02T01:25:26.922461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:26.974062Z","title":"Dogr: Towards versatile visual document grounding and referring","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:26.974062Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:33089356f4c5e339bd502455e2497aace28ae23a32411acceeae2c7e020670ae","observation_id":"343f646b-b3b4-4c6f-9796-5d88adeb675c","resolution":{"observed_at":"2026-08-02T01:25:26.974062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:27.020594Z","title":"X., Wu, H., Wang, W., Feng, F., Wang, C., Luan, H., and Chua, T.-S","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:27.020594Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:b5ce8892c2ed04e9bdc28cba29d7c3233a5d517fc1c5e9d61a906b66539e26f4","observation_id":"881efef6-66ec-4da9-baf2-f95d14aa9d36","resolution":{"observed_at":"2026-08-02T01:25:27.020594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14056","last_updated":"2024-12-18T17:06:21Z","snapshot_observed_at":"2026-08-21T02:06:11.081024Z","submitted_at":"2024-12-18T17:06:21Z","title":"A Review of Multimodal Explainable Artificial Intelligence: Past, Present and Future","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14056","snapshot_observed_at":"2026-08-02T01:25:27.067817Z","title":"arXiv preprint arXiv:2412.14056 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:27.067817Z"},"links":{"cited_paper":"/paper/2412.14056","citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:34669af82d6d05ce2216d83179625492a2be07b89edeec9c130e63419f5a8d89","observation_id":"d406b3d1-687d-44c1-b6c5-f9157c4032d9","resolution":{"observed_at":"2026-08-02T01:25:27.067817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-12T17:21:52.298102Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-02T01:25:27.102713Z","title":"arXiv preprint arXiv:2501.00321 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:27.102713Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:c2d33f6a555b5c5ea9d03744450fc883094326807ee341e706f35de45fce6ccc","observation_id":"faaf72c8-c70b-48df-8122-aa6204c9120c","resolution":{"observed_at":"2026-08-02T01:25:27.102713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:27.131427Z","title":"arXiv preprint arXiv:2504.04974 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:27.131427Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:01034c4515fc601db8cdb2dbb69fd6b9dad365d30ea71f90988f1429c009fbd8","observation_id":"d2601945-8aa6-4a3e-bfda-40ed08127078","resolution":{"observed_at":"2026-08-02T01:25:27.131427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:27.252393Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:27.252393Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:379a8c404141d2b33a30169131120a2f7b5fa4d561287b3da9ec6463b34483ab","observation_id":"a2371b19-3b37-43fd-a7f9-b8aa6524e05d","resolution":{"observed_at":"2026-08-02T01:25:27.252393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:27.350922Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:27.350922Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:1540f688187b8efef845313e7176471531aa888cd761aad4e2a9fa2779a14a0a","observation_id":"b8b2dc5d-28dd-4f54-b0c5-edaeb0f13d97","resolution":{"observed_at":"2026-08-02T01:25:27.350922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-02T01:25:27.404873Z","title":"arXiv preprint arXiv:2501.12948 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:27.404873Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:389fadc6233a2013d9ae06380bc1c468676935ea1c31cda1f9f600e648ba93a7","observation_id":"b4ce0d30-568d-4922-b27b-bdb39d6b2803","resolution":{"observed_at":"2026-08-02T01:25:27.404873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-02T01:25:27.506499Z","title":"arXiv preprint arXiv:2501.17161 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:27.506499Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:1b4bb81aeaecfdaa18a8cf5f4f3bfb91d4ff0608e6fe15a08bd19fc41b328120","observation_id":"49bfeff3-2245-4a6e-8937-3016b5f99916","resolution":{"observed_at":"2026-08-02T01:25:27.506499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.12235","last_updated":"2026-05-08T20:26:21Z","snapshot_observed_at":"2026-08-18T02:54:59.815800Z","submitted_at":"2025-09-08T21:40:41Z","title":"RL Fine-Tuning Heals OOD Forgetting in SFT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.12235","snapshot_observed_at":"2026-08-02T01:25:27.583062Z","title":"arXiv preprint arXiv:2509.12235 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:27.583062Z"},"links":{"cited_paper":"/paper/2509.12235","citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:ab4465bd5f3b643c714fb9bd014cb8b2d754ff512698fd6035ee33f1888bf87f","observation_id":"9e956eb2-2da9-4612-9e43-fbb20a34db1a","resolution":{"observed_at":"2026-08-02T01:25:27.583062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-21T16:02:41.546193Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-02T01:25:27.678066Z","title":"5-vl technical report , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:27.678066Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:4e64bc878f3e75c2b7dbec1c90212ae58cb772520bf5e9a0eeebff596a7826f5","observation_id":"fec2b2e4-f917-40a7-81d4-de4e79f26ab0","resolution":{"observed_at":"2026-08-02T01:25:27.678066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-02T01:25:27.781991Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:27.781991Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:ec60097ee4be5147ea7465f9da4c2c7f4afacc2d8021a3ac8b70d4c61787b1f5","observation_id":"780c33be-6348-47c9-bfb3-3d95d8b7cfdf","resolution":{"observed_at":"2026-08-02T01:25:27.781991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:27.897612Z","title":"Proceedings of the 30th ACM international conference on multimedia , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:27.897612Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:6df6a209342c1afabe953cd0c56c4c512680dca5b79527d3164559e89d3b67c0","observation_id":"d300b33e-3241-4d92-b30f-7e733b518ebe","resolution":{"observed_at":"2026-08-02T01:25:27.897612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05595","last_updated":"2025-07-08T02:14:10Z","snapshot_observed_at":"2026-08-14T05:24:51.715708Z","submitted_at":"2025-07-08T02:14:10Z","title":"PaddleOCR 3.0 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05595","snapshot_observed_at":"2026-08-02T01:25:28.035910Z","title":"arXiv preprint arXiv:2507.05595 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:28.035910Z"},"links":{"cited_paper":"/paper/2507.05595","citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:cf37471a392dac8fecdaea663e070fdc9bdd9e14b087286f05857fb6049331c6","observation_id":"041c6618-0378-4711-b63f-3a4efcce3dc4","resolution":{"observed_at":"2026-08-02T01:25:28.035910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-02T01:25:28.204527Z","title":"arXiv preprint arXiv:2403.05530 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:28.204527Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:57e8b90cb5cff375cc8d6613ed2f90fb57433977475f83e49cce1f785f368ee9","observation_id":"2115405b-ec84-4213-b783-fee12364c78c","resolution":{"observed_at":"2026-08-02T01:25:28.204527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:28.272655Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:28.272655Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:e3ef7a6abb74d1b2d2df19cf96504c14a4c2efd41cb0127d0958f17b6ba812df","observation_id":"522b424f-c63c-430a-b981-315f58a06ab1","resolution":{"observed_at":"2026-08-02T01:25:28.272655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-15T17:53:32.952905Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00151","snapshot_observed_at":"2026-08-02T01:25:28.323502Z","title":"arXiv preprint arXiv:2412.00151 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:28.323502Z"},"links":{"cited_paper":"/paper/2412.00151","citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:5c38bbac859ede59338410c2a63a7dd1ebdb14e7ae1392c83c9c30238cdd997d","observation_id":"13c8431a-09e6-43fe-bf40-f1ecb82f34a6","resolution":{"observed_at":"2026-08-02T01:25:28.323502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-02T01:25:28.375861Z","title":"arXiv preprint arXiv:2306.15195 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:28.375861Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:eb180ceb63c1f8d12abc44a35d00c8a3c64c9982fec203900f5ba2a16b8a5acb","observation_id":"9432e48e-8716-4962-8802-5ef19a825d05","resolution":{"observed_at":"2026-08-02T01:25:28.375861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-08-12T17:07:18.793418Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-02T01:25:28.475131Z","title":"arXiv preprint arXiv:2310.07704 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:28.475131Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:e419e199e668a3332c42097c733866b4a7031fc21660f651400ce5b5e9fd1b5d","observation_id":"d9b59ccb-2086-4ed3-9858-5919c10c2246","resolution":{"observed_at":"2026-08-02T01:25:28.475131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11419","last_updated":"2024-08-21T16:54:23Z","snapshot_observed_at":"2026-08-20T13:01:54.240181Z","submitted_at":"2023-09-20T15:50:08Z","title":"KOSMOS-2.5: A Multimodal Literate Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11419","snapshot_observed_at":"2026-08-02T01:25:28.575255Z","title":"arXiv preprint arXiv:2309.11419 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:28.575255Z"},"links":{"cited_paper":"/paper/2309.11419","citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:f868505fd298b20eb72fc94cde896f5ced8052652070a869a86ac28c617204e1","observation_id":"af234a1e-faf5-40b5-8d18-930e6cf4014f","resolution":{"observed_at":"2026-08-02T01:25:28.575255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:28.646952Z","title":"Farrar, Straus and Giroux , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:28.646952Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:7454757af377bc0d319a55f80d7331c6415e6aef6e5395b36217363df85c31a1","observation_id":"9adb5f5e-4e82-433d-95be-3339e344f9c3","resolution":{"observed_at":"2026-08-02T01:25:28.646952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07954","last_updated":"2025-04-10T17:58:27Z","snapshot_observed_at":"2026-08-16T12:42:16.250629Z","submitted_at":"2025-04-10T17:58:27Z","title":"Perception-R1: Pioneering Perception Policy with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07954","snapshot_observed_at":"2026-08-02T01:25:28.694126Z","title":"arXiv preprint arXiv:2504.07954 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:28.694126Z"},"links":{"cited_paper":"/paper/2504.07954","citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:1c3162fc6bc33dbe6ca6433afefe472fff3f3868db52fee2305220dbf402d1cd","observation_id":"54621a2c-7471-45b4-94fc-9b72a41f2ae0","resolution":{"observed_at":"2026-08-02T01:25:28.694126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:28.757507Z","title":"The Thirty-ninth Annual Conference on Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:28.757507Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:470bbd59bab5cea300ba13d9f1ff28d162a25bad4b0b172ac8d90efdb775761b","observation_id":"7419a4c0-5df5-4b11-9c48-0d4ee9eb397d","resolution":{"observed_at":"2026-08-02T01:25:28.757507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:28.830889Z","title":"arXiv preprint arXiv:2503.20752 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:28.830889Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:b41ca6eac5b248efd859d5e4d3827b9ce9ae54bf4294977976e5a4a619ff9270","observation_id":"12030f40-4f56-4021-904a-ae70d92b54d8","resolution":{"observed_at":"2026-08-02T01:25:28.830889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:28.922743Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:28.922743Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:abc296e87b7c0ee9498a772d29b44c353ff8c99bef8d3b6879c5df5351d460dd","observation_id":"79ad8275-70e7-4b9b-9103-2f8c9b7edef4","resolution":{"observed_at":"2026-08-02T01:25:28.922743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:28.996885Z","title":"International Conference on Document Analysis and Recognition , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:28.996885Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:50cd8c48099e8422c68b01e592d283a22048c46c47c1972fed136b7e7dd333f9","observation_id":"7ad47b11-3858-4566-bdcb-edff050db110","resolution":{"observed_at":"2026-08-02T01:25:28.996885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:29.136088Z","title":"International Conference on Document Analysis and Recognition , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:29.136088Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:89de5aaf815995046c5a6cf875c7f224ae806f7e927311accd86852b038745b2","observation_id":"5593d532-4328-4f7c-a157-7e8cd098284f","resolution":{"observed_at":"2026-08-02T01:25:29.136088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:29.294248Z","title":"Proceedings of the 46th International ACM SIGIR Conference on Research and Development in Information Retrieval , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:29.294248Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:76b639117e40d609a463cc1dcd31e7bdeb3789faa0dfe8f0d76fafb038167c84","observation_id":"f683b3cf-f5ff-4205-bda7-56c9c97b909c","resolution":{"observed_at":"2026-08-02T01:25:29.294248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:29.426738Z","title":"Giovannini et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:29.426738Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:d70ecb2d76068eb18e95a0493d43201c0d195868958daba44511f0ed50755f54","observation_id":"fa4f7381-55aa-418b-870c-131d313286db","resolution":{"observed_at":"2026-08-02T01:25:29.426738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:29.514942Z","title":"arXiv e-prints , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:29.514942Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:b53d0db9bad4f92c301f7e08b030014465267891c156608287cd08b5c3614d5b","observation_id":"701567ac-527d-4b96-8970-565cee502a47","resolution":{"observed_at":"2026-08-02T01:25:29.514942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-19T07:59:58.721057Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-02T01:25:29.557821Z","title":"arXiv preprint arXiv:2503.01785 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:29.557821Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:8318939d2a869c6caffc743897d76105976a7e4c8bb11e82e4003dac788561fc","observation_id":"7a79af6e-fca0-46a9-bd40-448eb7c6c724","resolution":{"observed_at":"2026-08-02T01:25:29.557821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-16T02:03:48.252223Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-02T01:25:29.590993Z","title":"arXiv preprint arXiv:2503.06749 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:29.590993Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:db6d0c828819a859fdf7106e080074bad7ef2af2657ce33131ab231a5bc7e3cc","observation_id":"96b560bd-7b97-4032-a3a5-ba05062031f3","resolution":{"observed_at":"2026-08-02T01:25:29.590993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-14T23:38:19.973422Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-02T01:25:29.636892Z","title":"arXiv preprint arXiv:2504.07615 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:29.636892Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:2fed2371b0a18aaf4ed7223bbd7980b80a170f6828655ecb445430c4d0eed6c8","observation_id":"9d1271e7-f5f7-4949-82fc-f1c27418339a","resolution":{"observed_at":"2026-08-02T01:25:29.636892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:29.667195Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:29.667195Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:cd6c8f5e4f61352993c94a34883a2ad767b7d0897cdf594d5c54f7dbdb4d8651","observation_id":"1be60655-032b-4dae-8849-3444dc55399e","resolution":{"observed_at":"2026-08-02T01:25:29.667195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:29.699471Z","title":"GitHub repository , howpublished =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:29.699471Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:ec0189bdadb9af0888a9f93fa87e7eba7d9695617a07e34d2341acf2eb49a8a5","observation_id":"0652bd7b-1633-4164-8c7a-dd63c29e3102","resolution":{"observed_at":"2026-08-02T01:25:29.699471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:29.732418Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:29.732418Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:8bb36b61a5a12c3f54d5782c8ccf0dba65238346b1e6e1ddb229c2e77181f5c5","observation_id":"090466a4-ad6c-47ec-995c-9690a034761f","resolution":{"observed_at":"2026-08-02T01:25:29.732418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:29.781391Z","title":"Towards Visual Grounding: A Survey , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:29.781391Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:0da9040a8db84030c253587cd694a050d737fb5ae06113bc7ab8d0888f1aaad5","observation_id":"159a1476-8bce-4e1a-a9b3-9158c145de9e","resolution":{"observed_at":"2026-08-02T01:25:29.781391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:29.816900Z","title":"arXiv preprint arXiv:2509.10345 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:29.816900Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:9351963f7352487352d56176975b0ccdf77b275de5103c4bb1f1c2e02ae56046","observation_id":"e4edaa9f-d5c2-4046-b961-43df417ede1d","resolution":{"observed_at":"2026-08-02T01:25:29.816900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:29.847526Z","title":"MMDocBench: Benchmarking Large Vision-Language Models for Fine-Grained Visual Document Understanding and Grounding","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:29.847526Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:5254c6b212a99105481601bc0e33522251f487ffd1d3d4f5186a3c4ce3df08a4","observation_id":"27bf238b-3274-4a5f-a3da-0091ec70a33b","resolution":{"observed_at":"2026-08-02T01:25:29.847526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:29.882104Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:29.882104Z"},"links":{"citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:973461da65f8c8eb4d9542982c077947afa7b1c1eb05d5d0bd8cb00d9e1c24ff","observation_id":"f994e11e-2b88-4883-af63-08b7a51a4cb2","resolution":{"observed_at":"2026-08-02T01:25:29.882104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-17T01:29:14.073081Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2607.14682."}