{"as_of":"2026-08-08T08:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:733348cc6101d8385716af821b28f5889a00b1845d5debc5d79c9fbec82e7a42","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:42:31.079587Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T07:13:06.644583Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens","version":1},"cited_work":{"arxiv_id":"2410.05261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05261","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TextHawk2: A large vision- language model excels in bilingual OCR and grounding with 16 × fewer tokens","venue":null,"work_id":"424307f9-b0f3-4ee8-aefb-23b4485205d5","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":286,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2410.05261","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:994ec79edf77c1e903cee8f5d629ce2c456bad7d5abaec4cfb847e0f7d12c34c","observation_id":"a6719a44-8107-49c8-ba88-5c2df4e4c016","resolution":{"observed_at":"2026-05-10T13:23:58.272883Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens","version":1},"cited_work":{"arxiv_id":"2410.05261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05261","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TextHawk2: A large vision- language model excels in bilingual OCR and grounding with 16 × fewer tokens","venue":null,"work_id":"424307f9-b0f3-4ee8-aefb-23b4485205d5","year":2024},"citing_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-05-11T10:09:21.542356Z"},"links":{"cited_paper":"/paper/2410.05261","citing_paper":"/paper/2412.10302"},"observation_digest":"sha256:7658a7a13382dd9bc72c5de9358dd1073b98046fdbe958568ea5c506ecf7b15b","observation_id":"51d4c1cb-6033-4345-a32b-c74ed19ae48d","resolution":{"observed_at":"2026-05-11T10:09:26.325640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens","version":1},"cited_work":{"arxiv_id":"2410.05261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05261","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TextHawk2: A large vision- language model excels in bilingual OCR and grounding with 16 × fewer tokens","venue":null,"work_id":"424307f9-b0f3-4ee8-aefb-23b4485205d5","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":141,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2410.05261","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:ee19ca46d979f040a6db3025faf137d4b661d34b34c82117a4e6ee97cb6ae1d8","observation_id":"8e87d110-f4fe-44ac-9097-1b8a3435c0db","resolution":{"observed_at":"2026-05-10T13:41:08.163440Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05261","snapshot_observed_at":"2026-08-07T15:42:31.079587Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14059","last_updated":"2025-05-20T08:03:59Z","snapshot_observed_at":"2026-08-08T07:54:09.757528Z","submitted_at":"2025-05-20T08:03:59Z","title":"Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:31.079587Z"},"links":{"cited_paper":"/paper/2410.05261","citing_paper":"/paper/2505.14059"},"observation_digest":"sha256:5ac7e5197857d11844d409b0fbf08d043d705c0f49a789f5695757edc1a8593a","observation_id":"d579bcc5-90ce-4206-a9d1-ca44152c45a2","resolution":{"observed_at":"2026-08-07T15:42:31.079587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05261","snapshot_observed_at":"2026-08-07T14:57:21.429164Z","title":"Texthawk2: A large vision- language model excels in bilingual ocr and grounding with 16x fewer tokens.arXiv preprint arXiv:2410.05261, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17163","last_updated":"2026-05-26T01:50:12Z","snapshot_observed_at":"2026-08-07T14:52:59.748689Z","submitted_at":"2025-05-22T15:25:14Z","title":"OCR-Reasoning Benchmark: Unveiling the True Capabilities of MLLMs in Complex Text-Rich Image Reasoning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:21.429164Z"},"links":{"cited_paper":"/paper/2410.05261","citing_paper":"/paper/2505.17163"},"observation_digest":"sha256:2429307bda4792f3f788b4add24c370f6c0adab76384e42f8d852743a6c08b4a","observation_id":"73163043-530e-41f2-8ede-891deaf0a7d3","resolution":{"observed_at":"2026-08-07T14:57:21.429164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens","version":1},"cited_work":{"arxiv_id":"2410.05261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05261","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TextHawk2: A large vision- language model excels in bilingual OCR and grounding with 16 × fewer tokens","venue":null,"work_id":"424307f9-b0f3-4ee8-aefb-23b4485205d5","year":2024},"citing_paper":{"arxiv_id":"2507.09861","last_updated":"2026-04-21T13:31:05Z","snapshot_observed_at":"2026-07-06T21:56:35.665677Z","submitted_at":"2025-07-14T02:10:31Z","title":"A Survey on MLLM-based Visually Rich Document Understanding: Methods, Challenges, and Emerging Trends","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-19T04:38:49.512293Z"},"links":{"cited_paper":"/paper/2410.05261","citing_paper":"/paper/2507.09861"},"observation_digest":"sha256:b275f4234e42bcb6273efbba47f023c23957d92213f2743f93233d54a6f24c0e","observation_id":"1b75d618-2b7d-4489-bec3-61f553f0e1ad","resolution":{"observed_at":"2026-05-19T04:42:04.361196Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05261","snapshot_observed_at":"2026-08-06T13:45:18.536837Z","title":"Tex- thawk2: A large vision-language model excels in bilin- gual ocr and grounding with 16x fewer tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20145","last_updated":"2025-07-27T06:44:53Z","snapshot_observed_at":"2026-08-07T23:37:59.884624Z","submitted_at":"2025-07-27T06:44:53Z","title":"Multi-Agent Interactive Question Generation Framework for Long Document Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:45:18.536837Z"},"links":{"cited_paper":"/paper/2410.05261","citing_paper":"/paper/2507.20145"},"observation_digest":"sha256:44f114034db9d5b408e8e1ba8b93e8e424ece3dadc92869b70e2e25259ef52a2","observation_id":"2ddefe12-f8f7-430b-932b-7aec5aeb1566","resolution":{"observed_at":"2026-08-06T13:45:18.536837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens","version":1},"cited_work":{"arxiv_id":"2410.05261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05261","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TextHawk2: A large vision- language model excels in bilingual OCR and grounding with 16 × fewer tokens","venue":null,"work_id":"424307f9-b0f3-4ee8-aefb-23b4485205d5","year":2024},"citing_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"reference_index":170,"source":"pdf_text","source_observed_at":"2026-05-10T11:58:58.660564Z"},"links":{"cited_paper":"/paper/2410.05261","citing_paper":"/paper/2508.18265"},"observation_digest":"sha256:94f39f3aca6e62f8302462e40bad174f5775fb61a91925f1c111fbc792fe3a66","observation_id":"04693b41-5900-4236-b76b-41a5c210de4b","resolution":{"observed_at":"2026-05-10T11:58:58.933332Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens","version":1},"cited_work":{"arxiv_id":"2410.05261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05261","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TextHawk2: A large vision- language model excels in bilingual OCR and grounding with 16 × fewer tokens","venue":null,"work_id":"424307f9-b0f3-4ee8-aefb-23b4485205d5","year":2024},"citing_paper":{"arxiv_id":"2604.00161","last_updated":"2026-04-21T01:45:08Z","snapshot_observed_at":"2026-07-06T22:51:22.254518Z","submitted_at":"2026-03-31T19:09:55Z","title":"Q-Mask: Query-driven Causal Masks for Text Anchoring in OCR-Oriented Vision-Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T23:30:53.449935Z"},"links":{"cited_paper":"/paper/2410.05261","citing_paper":"/paper/2604.00161"},"observation_digest":"sha256:78d46876c5bfb3c381d20cb3ac5ee62376a0ce0a46f3799e04b0c25d6504b240","observation_id":"81fefa0e-6857-40a4-adf0-e7f5603a0335","resolution":{"observed_at":"2026-05-13T23:33:26.644288Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens","version":1},"cited_work":{"arxiv_id":"2410.05261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05261","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TextHawk2: A large vision- language model excels in bilingual OCR and grounding with 16 × fewer tokens","venue":null,"work_id":"424307f9-b0f3-4ee8-aefb-23b4485205d5","year":2024},"citing_paper":{"arxiv_id":"2604.09442","last_updated":"2026-04-10T15:58:31Z","snapshot_observed_at":"2026-07-06T22:58:17.167367Z","submitted_at":"2026-04-10T15:58:31Z","title":"UIPress: Bringing Optical Token Compression to UI-to-Code Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T17:21:32.024105Z"},"links":{"cited_paper":"/paper/2410.05261","citing_paper":"/paper/2604.09442"},"observation_digest":"sha256:301ab2f810db93fb019d5a0957e8f0dd9032ba7b61ce340b4954020ae4468266","observation_id":"19b594b1-1a15-4592-a419-388cb0803ad0","resolution":{"observed_at":"2026-05-11T07:00:59.204276Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens","version":1},"cited_work":{"arxiv_id":"2410.05261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05261","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TextHawk2: A large vision- language model excels in bilingual OCR and grounding with 16 × fewer tokens","venue":null,"work_id":"424307f9-b0f3-4ee8-aefb-23b4485205d5","year":2024},"citing_paper":{"arxiv_id":"2604.13029","last_updated":"2026-04-14T17:58:22Z","snapshot_observed_at":"2026-07-06T23:01:05.634599Z","submitted_at":"2026-04-14T17:58:22Z","title":"Visual Preference Optimization with Rubric Rewards","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T15:45:52.980881Z"},"links":{"cited_paper":"/paper/2410.05261","citing_paper":"/paper/2604.13029"},"observation_digest":"sha256:4e2cd79dca18f0527c85d8bc5256e91b290da24eb76340b04517468edfda9111","observation_id":"793c502c-88b8-4fad-ab15-0882408abbc4","resolution":{"observed_at":"2026-05-11T09:56:00.866790Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens","version":1},"cited_work":{"arxiv_id":"2410.05261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05261","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TextHawk2: A large vision- language model excels in bilingual OCR and grounding with 16 × fewer tokens","venue":null,"work_id":"424307f9-b0f3-4ee8-aefb-23b4485205d5","year":2024},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-07-06T23:30:02.207108Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"cited_paper":"/paper/2410.05261","citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:1e4a792f8ee70e17556e6e7c7811cdcfd2c546f48eeac6fa0864579c9032cf96","observation_id":"daf5c038-6a87-4bd2-ad6e-2659742359a8","resolution":{"observed_at":"2026-05-20T07:13:06.646603Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2410.05261/citation-record","integrity":"/paper/2410.05261/integrity","json":"/paper/2410.05261/citation-record.json","paper":"/paper/2410.05261"},"outbound":[],"paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2410.05261."}