{"as_of":"2026-08-07T10:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fb6528b41a5219770afb66a523f6707892b5a30c632989ae3917567aa0b2cbf2","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:34:38.340134Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.21316/citation-record","integrity":"/paper/2506.21316/integrity","json":"/paper/2506.21316/citation-record.json","paper":"/paper/2506.21316"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:41.702680Z","title":"Manmatha","venue":null,"work_id":"059cb74f-62c1-4e4e-b017-29951643c481","year":2023},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-06T22:24:48.218621Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:36.769699Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:128b2a4b67e595741144be21a6e1f56f5ed8343eb2b59f68b690c918c422eb6c","observation_id":"08222e7e-2dc9-4fb1-a287-4bf071b47021","resolution":{"observed_at":"2026-08-06T22:34:41.825117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:41.444333Z","title":"Paddleocr, awesome multilingual ocr toolkits based on paddlepaddle","venue":null,"work_id":"9be5d9e5-5bd1-4b57-8706-15eced82b686","year":2020},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-06T22:24:48.218621Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:36.835297Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:eda8fc09059cc579f1834fd90284760c183fc66164363b510974edb51cb716f7","observation_id":"818156ef-effa-486f-b649-57812d72f569","resolution":{"observed_at":"2026-08-06T22:34:41.576762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:41.230229Z","title":"Bharatgen unveils patram: India’s pioneer- ing vision-language foundation model for document intelli- gence, 2025","venue":null,"work_id":"552766bf-a9db-4e0b-9a49-1e765819d599","year":2025},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-06T22:24:48.218621Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:36.925134Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:2ac72e310745fa2f33467d81eabc7f7a365b14df293e0d75c24aaa116e06273a","observation_id":"734429a8-cdfb-4d64-a25d-c84fc13fdbfa","resolution":{"observed_at":"2026-08-06T22:34:41.327537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:41.076165Z","title":"Molmo and pixmo: Open weights and open data for state- of-the-art vision-language models, 2024","venue":null,"work_id":"2fe74ae3-fb57-43f0-a83c-41328ad76871","year":2024},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-06T22:24:48.218621Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:36.989772Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:e67c9b6b5690b685e7d333a25b86ccb2a9a3bd8aac0f5caa8be5cba3f77c7908","observation_id":"41ddf928-70c8-4b8e-a667-2cb316beb88d","resolution":{"observed_at":"2026-08-06T22:34:41.148905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T22:34:37.070851Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-06T22:24:48.218621Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:37.070851Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:7fa82c39cbf50d86d9ced2066a04a1e61f70514bb0f9939c4385581522db6d51","observation_id":"b842fa82-5fc4-4a65-8a4d-9ea92d83c69f","resolution":{"observed_at":"2026-08-06T22:34:37.070851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03420","last_updated":"2024-09-09T05:36:27Z","snapshot_observed_at":"2026-08-06T15:58:29.524516Z","submitted_at":"2024-09-05T11:09:00Z","title":"mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03420","snapshot_observed_at":"2026-08-06T22:34:37.142434Z","title":"mplug- docowl2: High-resolution compressing for ocr-free multi- page document understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-06T22:24:48.218621Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:37.142434Z"},"links":{"cited_paper":"/paper/2409.03420","citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:ac000ea1d1235372a2646e968be95997e13a8c31c7e39aec36ebcf1ea1124810","observation_id":"d5c9bf1e-a4e8-4fb4-b9f3-a137212ed0c2","resolution":{"observed_at":"2026-08-06T22:34:37.142434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:40.865222Z","title":"Layoutlmv3: Pre-training for document ai with uni- fied text and image masking","venue":null,"work_id":"327083d7-0823-4b2c-8992-91c13e527b31","year":2022},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-06T22:24:48.218621Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:37.230465Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:2de156934bdbb7f68bd49d19a3b6f12c55ad5394741b96a723583ac310afa038","observation_id":"f9551178-2d6b-4390-8a77-4060d5b445cb","resolution":{"observed_at":"2026-08-06T22:34:40.974738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:40.620654Z","title":null,"venue":null,"work_id":"fff00023-f65a-47ce-a7ff-5bc91bccd996","year":2023},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-06T22:24:48.218621Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:37.298695Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:c5f6d3930eec6913bd1abee271510f3437bc9d0efa343f0d21e4c1da65a2c40d","observation_id":"ff6eef45-1be0-4eb1-a914-190b55fc339d","resolution":{"observed_at":"2026-08-06T22:34:40.730665Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:37.388852Z","title":"Towards visual text grounding of multimodal large language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-06T22:24:48.218621Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:37.388852Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:62e7ee05aab8831b5651282ce693351ce829f31c6f40aabd49de981f67c73b2c","observation_id":"a3633cfb-e759-4e92-b1b0-df3cb5bc3d99","resolution":{"observed_at":"2026-08-06T22:34:37.388852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:40.449124Z","title":"Layoutllm: Layout instruction tun- ing with large language models for document understanding","venue":null,"work_id":"09d7d74d-bc0e-430b-9d18-d7484107eb6b","year":2024},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-06T22:24:48.218621Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:37.470543Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:bd8028b1e41a66c88df695f01739b277cc8dfaa2b22b01d6b8eed5d695a75a2e","observation_id":"f288daed-560b-4aaa-8e87-ae9c25f7473c","resolution":{"observed_at":"2026-08-06T22:34:40.548635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:40.285811Z","title":"Manmatha, and C","venue":null,"work_id":"3b47b948-5b18-4005-afaa-d972159d3d76","year":2021},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-06T22:24:48.218621Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:37.514020Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:6c8fdeec1725d4cb554decee3ad67f1137c31bf32db748dfb7b41bcca683e464","observation_id":"9d8a63d0-4dfb-4ce0-9cfa-fa3d159a3e8e","resolution":{"observed_at":"2026-08-06T22:34:40.370596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:40.091355Z","title":"doctr: Document text recognition","venue":null,"work_id":"e5eecdfd-54cb-43a1-a4ee-058d02ee5bd9","year":2021},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-06T22:24:48.218621Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:37.572451Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:38646d34ed4d644e96ecfc5f0893d85a4cb606fd9104ceec26a09bef3c7599d6","observation_id":"b8237044-855f-4bfa-9c99-a5fc9f649726","resolution":{"observed_at":"2026-08-06T22:34:40.168201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:39.909045Z","title":"Nagaraja, Vlad I","venue":null,"work_id":"844a66aa-59e2-4f6d-9abe-76af897dd143","year":2016},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-06T22:24:48.218621Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:37.633362Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:09a76203fb4d8a5a7a14ca13d2caf18d6b81805cdc1f9adfbcbffb05cf5b5b4f","observation_id":"bd85ff38-1840-4c48-99a1-e8d27e393c66","resolution":{"observed_at":"2026-08-06T22:34:39.997566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:39.686700Z","title":"Surya: A lightweight document ocr and analysis toolkit","venue":null,"work_id":"acd87b29-c742-446b-8955-589eadcac1c5","year":2025},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-06T22:24:48.218621Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:37.715820Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:071db87be72921c89c98251a90d9c17b8a36c003bbf064d12e46764467d69238","observation_id":"7293f1f5-efa8-4bdb-b161-831c66a9849a","resolution":{"observed_at":"2026-08-06T22:34:39.784297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.09550","last_updated":"2021-07-12T09:31:31Z","snapshot_observed_at":"2026-07-06T10:42:38.373062Z","submitted_at":"2021-02-18T18:51:47Z","title":"Going Full-TILT Boogie on Document Understanding with Text-Image-Layout Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.09550","snapshot_observed_at":"2026-08-06T22:34:37.794185Z","title":"Go- ing full-tilt boogie on document understanding with text- image-layout transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-06T22:24:48.218621Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:37.794185Z"},"links":{"cited_paper":"/paper/2102.09550","citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:4e411032afaec3d86c1e56b9c461a83d1a385c9758527cf27238ed72626300b5","observation_id":"e3ed71f0-a2e2-4a52-9176-52848ac7601f","resolution":{"observed_at":"2026-08-06T22:34:37.794185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:39.558892Z","title":"Grounding of textual phrases in images by reconstruction","venue":null,"work_id":"301f1d45-9790-49ef-8d21-3cbb9cdaec82","year":2015},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-06T22:24:48.218621Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:37.831093Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:78a2319554cbd2d1ef7dba8cb96accb247024c9e0088735b8ad155001da2f607","observation_id":"03772cf5-7c6c-4ee2-879c-a242821c1315","resolution":{"observed_at":"2026-08-06T22:34:39.637526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:39.338700Z","title":"Unifying vision, text, and layout for universal document processing","venue":null,"work_id":"8d9e6bc9-9200-4d79-96ff-85a48d26b2e7","year":2023},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-06T22:24:48.218621Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:37.916791Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:ca5421530d9ea6aa61f2c8e8860c117e02522411875db701fa9d7ad6bb775ff5","observation_id":"6297c7f0-0d49-47ab-ad74-2602afa5bd94","resolution":{"observed_at":"2026-08-06T22:34:39.447752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:39.145121Z","title":"Gpt-4 technical report","venue":null,"work_id":"38496032-e309-42f1-b4d8-0e8664ddb747","year":2023},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-06T22:24:48.218621Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:38.003951Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:ef400495d2e3c5a073803b84ca2f1b17b244eb1fa34590d231ad6981c55ffd45","observation_id":"182a84dd-83fc-4dbc-8716-a71a0b4d09d8","resolution":{"observed_at":"2026-08-06T22:34:39.249161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05935","last_updated":"2023-04-01T10:00:35Z","snapshot_observed_at":"2026-08-06T01:25:28.963481Z","submitted_at":"2022-12-07T10:09:49Z","title":"Hierarchical multimodal transformers for Multi-Page DocVQA","version":2},"cited_work":{"arxiv_id":"2212.05935","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.05935","snapshot_observed_at":"2026-08-06T22:34:38.458141Z","title":"Hierarchical multimodal transformers for Multi-Page DocVQA","venue":"cs.CV","work_id":"a48ec8c4-6c29-4a58-a06d-046f64861621","year":2022},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-06T22:24:48.218621Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:38.065829Z"},"links":{"cited_paper":"/paper/2212.05935","citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:08a0da43fa3ed54cb51886ef7fed92f1d4d2de576654059af4c31b7a886660bf","observation_id":"887b9de5-1192-48e0-ac6c-e7577ae81940","resolution":{"observed_at":"2026-08-06T22:34:38.562815Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:38.962988Z","title":"Docllm: A layout-aware gener- ative language model for multimodal document understand- ing","venue":null,"work_id":"a7e28d40-d955-4bb0-9be7-0361a298b89e","year":2023},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-06T22:24:48.218621Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:38.137910Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:20eada3889d6962e236e82e1f2e6bbfaaf5e2487f22e6f88275ca173a1a2e1ad","observation_id":"53c3c62c-21e8-45b2-908f-e25224daeeaa","resolution":{"observed_at":"2026-08-06T22:34:39.037272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:38.810563Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution, 2024","venue":null,"work_id":"b814fc54-923f-4b7f-bd3e-699b9bb73646","year":2024},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-06T22:24:48.218621Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:38.184240Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:1b18f476eff0ad097e1098da8ef8bc8722aabfd3690753eab566c4ef18c3a029","observation_id":"69761ad4-aa54-4e5e-a872-fc183c7c1275","resolution":{"observed_at":"2026-08-06T22:34:38.861845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13194","last_updated":"2023-12-15T08:12:32Z","snapshot_observed_at":"2026-07-06T16:50:58.750467Z","submitted_at":"2023-11-22T06:46:37Z","title":"Towards Improving Document Understanding: An Exploration on Text-Grounding via MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13194","snapshot_observed_at":"2026-08-06T22:34:38.254340Z","title":"Towards improving document understand- ing: An exploration on text-grounding via mllms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-06T22:24:48.218621Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:38.254340Z"},"links":{"cited_paper":"/paper/2311.13194","citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:28ec31b52b46ba0d1b598bd0f10a8a6022dbe4406b450831f7ffd1f251bc9385","observation_id":"1703ad8c-9734-4663-ade3-b85c758fef5a","resolution":{"observed_at":"2026-08-06T22:34:38.254340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20206","last_updated":"2026-08-04T09:37:47Z","snapshot_observed_at":"2026-08-07T10:09:33.287663Z","submitted_at":"2024-12-28T16:34:35Z","title":"Toward Visual Grounding: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20206","snapshot_observed_at":"2026-08-06T22:34:38.310883Z","title":"Towards visual grounding: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-06T22:24:48.218621Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:38.310883Z"},"links":{"cited_paper":"/paper/2412.20206","citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:2c81354986112503074c0dd061f16bb018730b672578bca923661c1316aec8e1","observation_id":"2e77bf65-a5ce-412f-873c-d7c3da2d502a","resolution":{"observed_at":"2026-08-06T22:34:38.310883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17125","last_updated":"2025-08-06T10:02:43Z","snapshot_observed_at":"2026-07-06T19:57:06.097199Z","submitted_at":"2024-11-26T05:38:34Z","title":"DOGR: Towards Versatile Visual Document Grounding and Referring","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17125","snapshot_observed_at":"2026-08-06T22:34:38.340134Z","title":"Doge: Towards versatile visual document grounding and referring","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-06T22:24:48.218621Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:38.340134Z"},"links":{"cited_paper":"/paper/2411.17125","citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:52a23943fdbde2772ac7ba6a6992f42c9a364ebfcf4d3c2434c9c15e0affcb87","observation_id":"83781985-7053-40ae-a698-8e9887e53953","resolution":{"observed_at":"2026-08-06T22:34:38.340134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T22:24:48.218621Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":1,"verified_fuzzy":15},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2506.21316."}