{"as_of":"2026-08-08T12:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b6a443d4d6488d3b5b988e33ec4eb939669cf926d80bfd7f4381aeee17a09887","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:38:52.885866Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T01:00:45.178631Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T01:00:46.378040Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"cited_work":{"arxiv_id":"2506.21055","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.21055","snapshot_observed_at":"2026-08-06T01:00:46.378040Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","venue":"cs.CV","work_id":"b955c816-64c3-474a-888f-e468588e77f5","year":2025},"citing_paper":{"arxiv_id":"2508.04055","last_updated":"2025-08-06T03:30:39Z","snapshot_observed_at":"2026-08-06T01:00:37.862729Z","submitted_at":"2025-08-06T03:30:39Z","title":"Uni-DocDiff: A Unified Document Restoration Model Based on Diffusion","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T01:00:45.178631Z"},"links":{"cited_paper":"/paper/2506.21055","citing_paper":"/paper/2508.04055"},"observation_digest":"sha256:78e53d858f3f97239e57a670dacbce64057e0f2e16404027fa501d8801eab689","observation_id":"661b1476-0953-407c-9c64-6fdd8c1b667d","resolution":{"observed_at":"2026-08-06T01:00:46.482246Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.21055/citation-record","integrity":"/paper/2506.21055/integrity","json":"/paper/2506.21055/citation-record.json","paper":"/paper/2506.21055"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:07.364731Z","title":"Visual text processing: A comprehensive review and unified evaluation, 2025","venue":null,"work_id":"ef42b4e8-4386-4e0d-87d8-8925de9d6684","year":2025},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:46.244610Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:87de3787c43f8eb0c0cb40ed032305524205e18ec473163aeffb7e26ec6bff2b","observation_id":"921fc7de-ed9d-4b22-b318-c52ffdcc0946","resolution":{"observed_at":"2026-08-06T22:39:07.469384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:07.234255Z","title":"TextCtrl: Diffusion-based scene text editing with prior guidance control","venue":null,"work_id":"4fdaa503-d749-4565-9b00-7a7a16d61cc2","year":2024},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:46.337723Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:22c6f57ae77f64523f3c98bcea0413c0d676fb3ab0312cb2a8610b318cdf9e1b","observation_id":"df18eaf1-bf02-408a-ab43-ce6eb87f244d","resolution":{"observed_at":"2026-08-06T22:39:07.308125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:07.149384Z","title":"The devil is in fine-tuning and long-tailed problems: A new benchmark for scene text detection","venue":null,"work_id":"957c40d9-8fe1-4a6e-90f5-ff466ed33262","year":2025},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:46.447983Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:761575de4414e2a85d6c64a46e337a2bf37b43c2673ff3927939f9c852e4c23c","observation_id":"1d63aa5d-024f-478c-85b4-aac2aa887073","resolution":{"observed_at":"2026-08-06T22:39:07.191611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:06.950552Z","title":"Perceiving ambiguity and semantics without recognition: An efficientandeffectiveambiguousscenetextdetector","venue":null,"work_id":"7f24472e-402a-4a89-86c8-9c0910e7ecbf","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:46.543916Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:917fb512b749e2570aab7f2a7b538db58ea09f65cb8aeecb1a4e46333f4c2cbf","observation_id":"c0631c98-09bc-439b-96dc-6aab131559b3","resolution":{"observed_at":"2026-08-06T22:39:07.094259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:06.635877Z","title":"Self-training for domain adaptive scene text detection","venue":null,"work_id":"78819c2d-1dbd-46da-995f-bb4a13f269cb","year":2021},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:46.630584Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:de8e596355f55d9f58139d3492bc43c3ec0c52726f21e50a013aae194721635b","observation_id":"b7258021-25c7-4364-aaf7-fb2b4d237f6a","resolution":{"observed_at":"2026-08-06T22:39:06.779164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:06.337868Z","title":"SEED: Semantics enhanced encoder-decoder framework for scene text recognition","venue":null,"work_id":"54a8d0c2-bf53-470a-a0b3-c4cac58abe11","year":2020},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:46.798650Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:d9695b85f06870dabcf21644034f5b0b3d56a61a8ee00e565ff23a4555b770b8","observation_id":"a18ddd1f-7c39-40ab-9387-09568c8e5927","resolution":{"observed_at":"2026-08-06T22:39:06.455255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:05.975524Z","title":"PIMNet: A parallel, iterative and mimicking network for scene text recognition","venue":null,"work_id":"c3ee1aec-28fc-48e2-9e8a-bb5d05912577","year":2021},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:46.854090Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:3eb5c59a5e740110d808ac22bffb72e3e0cb930cb860e7cb72fa1e77ba0a6796","observation_id":"befb8960-ebf7-4d31-93d5-b3eedda41466","resolution":{"observed_at":"2026-08-06T22:39:06.191742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:05.713666Z","title":"IPAD: Iterative, parallel, and diffusion- based network for scene text recognition.IJCV, 2025","venue":null,"work_id":"773b3458-be3a-4833-8778-08e7382a44a7","year":2025},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:46.967109Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:a9029a8e3a6d94198a5fc666461dff4164b745e375023474fb051db9a9994afe","observation_id":"e2015c11-edbe-4f8a-bbc2-2ca4c0337895","resolution":{"observed_at":"2026-08-06T22:39:05.840804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:05.386099Z","title":"Linguistics-aware masked image modeling for self-supervised scene text recognition","venue":null,"work_id":"65201c17-4e49-4918-a1c6-cc69075ade19","year":2025},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:47.064931Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:0505456dd3f40895ac0d31ce493a207795cc8f0d8b97efda79bc4d8ed7558b8d","observation_id":"8f606f82-ca5a-4ca6-a420-9a38f1192faf","resolution":{"observed_at":"2026-08-06T22:39:05.551498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:05.141953Z","title":"Divide rows and conquer cells: Towards structure recognition for large tables","venue":null,"work_id":"d8358538-a273-430e-a291-39262562a06f","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:47.122530Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:2633170a745a60e6eface76e5d9d2f16822ad3f103ea9766e58181fc5ad9529e","observation_id":"8c5985b4-d06c-44e9-89e7-35297a2116db","resolution":{"observed_at":"2026-08-06T22:39:05.267140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:04.918404Z","title":"Arbitrary reading order scene text spotter with local semantics guidance","venue":null,"work_id":"4de8606b-66bc-405a-8124-d05092521bd3","year":2025},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:47.179175Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:6b156ba86de7531758643505402df87a7435e42b244733a23526336260fa50eb","observation_id":"2612607d-2fcd-45c7-b656-4f5e1e9d79aa","resolution":{"observed_at":"2026-08-06T22:39:05.022831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:04.641669Z","title":"TPSNet: Reverse thinking of thin plate splines for arbitrary shape scene text representation","venue":null,"work_id":"d5d0192a-b3d7-4b77-9d78-a67c25639f8a","year":2022},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:47.296450Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:ffb728c024afaaa10dbf4995a76a9afbb8cf2201d53f61d29cc069a5b4aab749","observation_id":"072b1ef4-639b-4fd7-92cc-c02dec23a787","resolution":{"observed_at":"2026-08-06T22:39:04.787577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:04.400036Z","title":"TextBlockV2: Towards precise-detection-free scene text spotting with pre-trained language model.TOMM, 2025","venue":null,"work_id":"81c3325d-0a69-4635-85bc-93b8e7d59a58","year":2025},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:47.370098Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:4f24284a7885d7f156b4979c8a98966cd7a937127a4b4c8f38733d9921cac72c","observation_id":"bf975ee4-71aa-4dee-b357-45d8d148301d","resolution":{"observed_at":"2026-08-06T22:39:04.532935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:04.144897Z","title":"Beyond cropped regions: New benchmark and corresponding baseline for chinese scene text retrieval in diverse layouts","venue":null,"work_id":"0db8746f-6d77-4384-b62f-42ae62baa2f3","year":2025},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:47.459786Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:bdad7e02750748a16e948df9e8311afb833412e7e6e1e29435dff906de99e1da","observation_id":"21ebe37c-f3b9-43a7-b60f-1a18f559afda","resolution":{"observed_at":"2026-08-06T22:39:04.278269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:03.931659Z","title":"Focus, distinguish, and prompt: Unleashing clip for efficient and flexible scene text retrieval","venue":null,"work_id":"12580835-83f5-40fc-a987-b55120e4b8e7","year":2024},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:47.545081Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:16556422c55053fd6e2a9d3d022e0e7eb6cfc74f977ca3b29df9a2e4711009ee","observation_id":"454355a7-ea8f-4663-9f4e-cead2a9f40ee","resolution":{"observed_at":"2026-08-06T22:39:04.032662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:03.706742Z","title":"LDP: Generalizing to multilingual visual information extraction by language decoupled pretraining","venue":null,"work_id":"14c0e401-cf6c-4878-a32e-98602aec2416","year":2025},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:47.602859Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:6b177cabe94d2e5e1e31e4c4de4c002f6d65e46390a17cfdfc65c35d63862a49","observation_id":"4099a824-0b80-49ba-b8e6-9108ffe30297","resolution":{"observed_at":"2026-08-06T22:39:03.837997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:03.440741Z","title":"Beyond OCR+ VQA: Involving ocr into the flow for robust and accurate textvqa","venue":null,"work_id":"276f38df-e7b7-4f97-a32e-88e82d3b9a88","year":2021},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:47.657087Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:896b5b654f87070c320c932a86f574f33b6ba0b315b4b152a49508ca2d864e73","observation_id":"7733c693-127c-4ebf-a474-78af895e95e5","resolution":{"observed_at":"2026-08-06T22:39:03.573020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:03.202459Z","title":"Publaynet: largest dataset ever for document layout analysis","venue":null,"work_id":"6dae5be7-0d36-4f7c-924c-157e2d1932e4","year":2019},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:47.734594Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:f8b80c4561e3d23128280223fa940474b939896cab74981428228a048af02f05","observation_id":"60a873fb-d4fa-43f5-89c3-1a5efd2ab323","resolution":{"observed_at":"2026-08-06T22:39:03.338918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:02.966896Z","title":"Learning to extract semantic structure from documents using multimodal fully convolutional neural networks","venue":null,"work_id":"06bdb48e-889b-44e2-956a-78865c386113","year":2017},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:47.884876Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:525fa05c9e9ae34e02574a183a1e77f4d211f70384b32d4f5a01f43fe7f5b944","observation_id":"cd3e0c06-de16-45ab-a706-873f2996d133","resolution":{"observed_at":"2026-08-06T22:39:03.076783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:02.751716Z","title":"VSR: a unified framework for document layout analysis combining vision, semantics and relations","venue":null,"work_id":"c3db144f-abc2-4036-aabd-aa60ba1c43c3","year":2021},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:48.052018Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:063b1bdef39d19c643822663c6c60430abefaa5fb9081b2a19bd1512405d9954","observation_id":"8767b378-67d6-4a8c-9eee-a328f48daba3","resolution":{"observed_at":"2026-08-06T22:39:02.857871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:02.518677Z","title":"Attention where it matters: Rethinking visualdocumentunderstandingwithselectiveregionconcentration","venue":null,"work_id":"a2d3341a-9e1c-4edc-8d04-04a6e953366a","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:48.173827Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:7f5a41b031ff6ba9b79714849905e4d5b7b2496223322d2f9b16b456934243c6","observation_id":"0cb19cfa-b771-4b1d-8803-ce424b18c711","resolution":{"observed_at":"2026-08-06T22:39:02.651105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:02.375286Z","title":"Bros: A pre-trained language model focusing on text and layout for better key information extraction from documents","venue":null,"work_id":"08111d35-e141-4999-9725-5452dfaaaa19","year":2022},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:48.263161Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:74947e71104b8a3efaca2f95e98843794881ef2ae46d1a9b726587ba552ae11a","observation_id":"e4ec6bb0-f924-43c6-b61f-e0cd703c6372","resolution":{"observed_at":"2026-08-06T22:39:02.453593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:02.277206Z","title":"StrucText: Structured text under- standing with multi-modal transformers","venue":null,"work_id":"071e82ec-34a4-46db-a47a-19a70f42fbb5","year":1912},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:48.330162Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:fdd3fc84a9cd434c94ce6cd5715862900227642867cfeedcfc3e66e4421d8367","observation_id":"a4c66329-f255-4372-805d-1e8ff5af512b","resolution":{"observed_at":"2026-08-06T22:39:02.323169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:02.164503Z","title":"Cross-domain few-shot semantic segmentation","venue":null,"work_id":"4129e1b4-62e2-44b1-a446-5efe8da1f745","year":2022},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:48.417873Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:5e5c0009e1e3ed24068e8448b35099af7be8c6561efb7efc5df6af5b11e80d1e","observation_id":"2bdf5d4c-4b64-4e8f-b2e2-536026302043","resolution":{"observed_at":"2026-08-06T22:39:02.222363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:02.029248Z","title":"Pixel-by- pixel cross-domain alignment for few-shot semantic segmentation","venue":null,"work_id":"a0863946-c27a-46c2-b9e7-921c0142a233","year":2022},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:48.483181Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:2842da11abba3ffe0dad77ec86aad1413e49e0f0110c2f2f62b64c02a0e83a6a","observation_id":"1770ce1e-e27e-436b-ac3b-e21f24fc2741","resolution":{"observed_at":"2026-08-06T22:39:02.088914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:01.882236Z","title":"Restnet: Boosting cross-domain few-shot segmentation with residual transformation network","venue":null,"work_id":"d10f0a31-0aa9-467f-a737-caa1504a816f","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:48.565011Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:ba38207d6e69a935f1fd8f7745695102ec1a517f4435e798599fee7b1afb5e78","observation_id":"fd412c3c-44a6-4cf5-a217-accfda4fc02a","resolution":{"observed_at":"2026-08-06T22:39:01.952099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:01.713399Z","title":"Adapt before comparison: A new perspective on cross-domain few- shot segmentation","venue":null,"work_id":"fc022cc4-55f5-4c77-ac37-83673c0ec2f7","year":2024},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:48.631042Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:c54d3ba958f947ffd518b0514b8c35d71ac0ca5e9a5475cdd65331274512b49c","observation_id":"8fb3ee38-27cd-4b28-aa17-9fb62b5c1263","resolution":{"observed_at":"2026-08-06T22:39:01.792650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:01.548431Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv, 2024","venue":null,"work_id":"a9477d77-8c17-433f-ab1e-8fd784c996cf","year":2024},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:48.697756Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:019a60a6243fddc78eefc7ee0dd723393bcfbb0f975e7eb6748aa362f4a6dce2","observation_id":"1d813d51-284f-4518-8788-82ea6d872de7","resolution":{"observed_at":"2026-08-06T22:39:01.625785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:48.763757Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:48.763757Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:3e2d81ce7c237c8f8502f321187f415ee44e8d94fc3f2d0f62f04be2e7051adf","observation_id":"6549c2e4-07d8-425e-ace6-cd27321e2a16","resolution":{"observed_at":"2026-08-06T22:38:48.763757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:01.346416Z","title":"Faster R-CNN: To- wards real-time object detection with region proposal networks.IEEE TPAMI, 39(6):1137–1149, 2016","venue":null,"work_id":"e323960b-6208-4eef-a42e-7ed2832c0941","year":2016},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:48.852730Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:5475c2e2d77c2b4615977eee0ee3f8282be00ee9998584e8aafceb3ed6ade590","observation_id":"1a78d34e-21c0-48f7-89c7-24794415f3a5","resolution":{"observed_at":"2026-08-06T22:39:01.431066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:01.158661Z","title":"Mask R-CNN","venue":null,"work_id":"fbe8902a-41a5-4152-9d0e-ef57dcc158c7","year":2017},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:48.916308Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:e38aba6a6d51bf0ee1b7d7ee158791f3912a0f97f8d34d5469262b8125d8b7bf","observation_id":"38ef0995-0746-40c9-a746-8330974fa688","resolution":{"observed_at":"2026-08-06T22:39:01.256642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:01.008457Z","title":"M6doc: A large-scale multi-format, multi- type, multi-layout, multi-language, multi-annotation category dataset for modern document layout analysis","venue":null,"work_id":"e607dbe7-9153-4c93-813f-93f6b4d71e1e","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:48.998791Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:b13e3942be718a3807675c564b08ab4c7d66d601a71c471f7cf7da3fd44c4d3a","observation_id":"ccd31602-49ff-4d2a-bad1-7d7c4c2d1948","resolution":{"observed_at":"2026-08-06T22:39:01.093467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:00.787749Z","title":"Swindocseg- menter: An end-to-end unified domain adaptive transformer for document instance segmentation","venue":null,"work_id":"bfe0f0cf-3fec-4a56-91ec-2006737aa509","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:49.064809Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:e09cfa39f9c22db972203d8c0f495b0cdfd06595c1a21536c96ad5d8786e656a","observation_id":"45a2b99d-e596-4b45-9262-528555db8a48","resolution":{"observed_at":"2026-08-06T22:39:00.869863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:00.592915Z","title":"Dino: Detr with improved denoising anchor boxes for end-to- end object detection","venue":null,"work_id":"496975fb-08fb-4b13-af50-dce748b30dc7","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:49.137703Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:558a6db27c97a13ed316938edd05fc2090b4265312bca006181fd533b43a5142","observation_id":"bdb1cb97-3bf9-4cb2-8b7d-2609161a6dc4","resolution":{"observed_at":"2026-08-06T22:39:00.696527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:00.407899Z","title":"Selfdocseg: A self-supervised vision- based approach towards document segmentation","venue":null,"work_id":"47364a51-eee8-428e-9758-3b54552235c4","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:49.218198Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:3fd618b26d5d22a3796e5d0a86671e39362db822f85a51a613d9a540e1614a7d","observation_id":"d3f580ce-5f7a-44ab-837c-11e42be7dd61","resolution":{"observed_at":"2026-08-06T22:39:00.503904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:39:00.226244Z","title":"Bootstrap your own latent-a new approach to self-supervised learning.NeurIPS, 33:21271–21284, 2020","venue":null,"work_id":"9e1071d6-e85e-4148-b298-bbe09cd758ec","year":2020},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:49.286253Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:c5e7a27890613884b1fdc396e54663f4e82000549bf6c6228781d9d0640fb84c","observation_id":"6c2e2959-6cb4-42e9-ab25-eede11b423c8","resolution":{"observed_at":"2026-08-06T22:39:00.307140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:59.976919Z","title":"LayoutLM: Pre-training of text and layout for document image understanding","venue":null,"work_id":"447ef6ee-363e-4713-a2c6-e3a27caf1bb8","year":2020},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:49.367911Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:98e076bdd630ff758ce372716cc9a2461679a11aeeb5a9172400801918883f1d","observation_id":"4fd51609-9479-4c31-8847-8f59f16e751c","resolution":{"observed_at":"2026-08-06T22:39:00.111955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:59.723000Z","title":"LayoutLMv2: Multi-modal pre-training for visually-rich document understanding","venue":null,"work_id":"da3b1498-aa29-437d-8150-db4687c9216e","year":2021},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:49.431705Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:ce4574100990d6fb0908f6004d96778da55c1f75f22619bbda7e5fe09bd85734","observation_id":"bd1cdc0b-a5f2-44ec-9107-a78563609979","resolution":{"observed_at":"2026-08-06T22:38:59.856115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:59.565767Z","title":"LayoutLMv3: Pre-training for document ai with unified text and image masking","venue":null,"work_id":"121b2f21-0cde-430c-a53c-65ebed5f8cfb","year":2022},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:49.514096Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:b70b372810de1ce605f3d58916ca5eeefae35400ed7a9e73dd2d6ec78f7a12a5","observation_id":"c7a268cc-318d-4031-a919-113652112c41","resolution":{"observed_at":"2026-08-06T22:38:59.630342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:59.389479Z","title":"BEiT: Bert pre-training of image transformers","venue":null,"work_id":"80e1c18e-fc6e-4444-a7ef-0f0b8d35c5dc","year":2022},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:49.605131Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:b598472feab9f28564eeca686b42532bc2c255e01be956c29ac24cf315a5d0a0","observation_id":"ba44459e-6ed5-46a9-be01-a926abcc3ff1","resolution":{"observed_at":"2026-08-06T22:38:59.452465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:59.221920Z","title":"Dit: Self-supervised pre-training for document image transformer","venue":null,"work_id":"49c293a1-d4b9-47e6-9acc-c96bb024f65e","year":2022},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:49.686587Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:1e51316af9835e1b0dcd750643602350807ad655793178889282962479ac3cc5","observation_id":"ed2a9473-153f-43df-9191-7e23a1845954","resolution":{"observed_at":"2026-08-06T22:38:59.299826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:59.088261Z","title":"Unidoc: Unified pretraining framework for document understanding.NeurIPS, 34:39–50, 2021","venue":null,"work_id":"cd1dccc7-4773-4fd3-a0f2-21430b374517","year":2021},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:49.769931Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:a886316e03a9264c5a66484f5a1c448f8c29569e2128fd6f1804d48e4ea86894","observation_id":"bec3a72a-68e0-4b71-8ee4-6e1ef1ee57f5","resolution":{"observed_at":"2026-08-06T22:38:59.149271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:58.880698Z","title":"StrucTexTv2: Masked visual-textual prediction for document image pre-training","venue":null,"work_id":"71762673-2d40-4eba-b906-00d8adb5ac19","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:49.839305Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:1e6a6d66949367ee9067e044921f5158c1c03871853e2bd41f08ba4c46f74c92","observation_id":"9e3fc858-264f-42e4-85a7-4d89f5acca7e","resolution":{"observed_at":"2026-08-06T22:38:58.975299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:58.631799Z","title":"Apseg: auto-prompt network for cross-domain few-shot semantic seg- mentation","venue":null,"work_id":"e3b39e6e-f9fc-474b-8b65-bf7e82d45135","year":2024},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:49.953976Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:e6701d3600961762c8a35539e5b2fb524f96804b727ac9f5701b51683aa85b64","observation_id":"c2564ae8-2255-4ef7-828e-ca25a88b8418","resolution":{"observed_at":"2026-08-06T22:38:58.760955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.11591","last_updated":"2021-08-27T04:56:07Z","snapshot_observed_at":"2026-07-06T11:41:38.428205Z","submitted_at":"2021-08-26T05:52:32Z","title":"LayoutReader: Pre-training of Text and Layout for Reading Order Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.11591","snapshot_observed_at":"2026-08-06T22:38:50.023808Z","title":"Layoutreader: Pre-training of text and layout for reading order detection.arXiv preprint arXiv:2108.11591, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:50.023808Z"},"links":{"cited_paper":"/paper/2108.11591","citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:4ad2608c3c4f3b812094fe21bd0230894f30eabc89d9ed77580c885859db5fe1","observation_id":"80159f3f-5dad-4ee6-9529-1f87ec88f970","resolution":{"observed_at":"2026-08-06T22:38:50.023808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:58.307425Z","title":"Reading order matters: Information extraction from visually-rich documents by token path prediction","venue":null,"work_id":"ec76f63c-4cd7-4baa-8fa6-a5556a11497a","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:50.087919Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:2f102955e8e61b0f9fdc924c8dc797fa63ea86a23e75910310c64d471989ecd3","observation_id":"0390b3f2-4f8d-4df2-aa48-69cc5f54a847","resolution":{"observed_at":"2026-08-06T22:38:58.459424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08836","last_updated":"2021-09-09T11:37:48Z","snapshot_observed_at":"2026-08-05T21:16:34.313942Z","submitted_at":"2021-04-18T12:16:00Z","title":"LayoutXLM: Multimodal Pre-training for Multilingual Visually-rich Document Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08836","snapshot_observed_at":"2026-08-06T22:38:50.217063Z","title":"Layoutxlm: Multimodal pre-training for multilingual visually-rich document understanding.arXiv preprint arXiv:2104.08836, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:50.217063Z"},"links":{"cited_paper":"/paper/2104.08836","citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:3d7f4f60d8618a7e1674e575e1c7bef6c7db8ca4aebf7e4ce4735ca1df289979","observation_id":"6b26cf17-dd66-49f4-9a30-dd7cdb7bedb3","resolution":{"observed_at":"2026-08-06T22:38:50.217063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:58.094489Z","title":"Query-driven generative network for document infor- mation extraction in the wild","venue":null,"work_id":"25c64872-b923-4d70-8202-1385f7623401","year":2022},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:50.316580Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:f79f0f2e03181914dd7b09fc6d5c2edd2d150ef69fe81113b2a69138d43df04c","observation_id":"7e986b6d-11bb-439b-bcee-4ef7f39d01c5","resolution":{"observed_at":"2026-08-06T22:38:58.207453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:57.828200Z","title":"Unifying vision, text, and layout for universal document processing","venue":null,"work_id":"54f8c5e6-af0b-4c6c-befb-16e26b33f7a9","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:50.398051Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:5f28085439578e5eb2c7296ea48f45c9e42cb50af0abe3286e6ad80ac2bec48c","observation_id":"31d1c692-08ff-4ada-8599-57c0c2b10db9","resolution":{"observed_at":"2026-08-06T22:38:57.991072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:57.535218Z","title":"Pix2struct: Screenshot parsing as pretraining for visual lan- guage understanding","venue":null,"work_id":"16f5db4c-28c8-4b75-8cd7-d005b63146a8","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:50.479272Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:d86dc1a4291b41e14e10eeeb01ab73b29d1daba9115df38ba603eeee1d87708b","observation_id":"68e6649e-86f3-4a96-b3eb-48491fb2c388","resolution":{"observed_at":"2026-08-06T22:38:57.639310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:57.267872Z","title":"Prestu: Pre-training for scene-text understanding","venue":null,"work_id":"3c85ce84-ce84-4834-980b-a031f6df52ab","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:50.561971Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:0aa9d1dd3a741230602bafb9cfc99f9e65faf7d096102f927aa24349609d22de","observation_id":"64f29873-8af6-4ea0-a559-09d700bfab73","resolution":{"observed_at":"2026-08-06T22:38:57.381479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:57.020559Z","title":"Ocr-free document understanding transformer","venue":null,"work_id":"a7986dc9-c277-402a-b5d3-430104f8c6f2","year":2022},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:50.644742Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:f462e0cb1a69794bc7f8cce576b20707005ca542d24bbb6fb8eb98e31f54d6a2","observation_id":"e4bb6a95-268f-453a-8315-0ee722efac8b","resolution":{"observed_at":"2026-08-06T22:38:57.147611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:56.790259Z","title":"Omniparser: A unified framework for text spotting key information extraction and table recognition","venue":null,"work_id":"624e33e2-79f4-4e16-a98a-bf53f6191138","year":2024},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:50.729423Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:ebfe08fc903f42d1cacae8d207624fcac3c4b61ff17115bf3b32f0be829ce822","observation_id":"3a004b56-f5cd-4783-b87c-90adcaba4625","resolution":{"observed_at":"2026-08-06T22:38:56.887151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:56.533535Z","title":"Icdar 2023 competition on structured text extraction from visually-rich document images","venue":null,"work_id":"5c727fea-cce1-49dc-b46b-334c7385c78b","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:50.821629Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:66938ed86e076745631a7446629bcadb39f88062c692354347c6a8466192b9ea","observation_id":"da40e932-5620-4d21-a338-cd5687f3217c","resolution":{"observed_at":"2026-08-06T22:38:56.677371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:56.225065Z","title":"Visual information extraction in the wild: practical dataset and end-to-end solution","venue":null,"work_id":"fdf412ef-9f06-4dc5-bdbc-4de683d285ff","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:50.897607Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:ee1ffe5211a9d1ee20eb377d2ea6d5d5a74a9cee3dc7414b6a13dacb9d12f5e8","observation_id":"94aaa468-dfda-487a-ae04-e1e26405d1f2","resolution":{"observed_at":"2026-08-06T22:38:56.358785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:55.910698Z","title":"Towards robust visual information extraction in real world: new dataset and novel solution","venue":null,"work_id":"f6b98714-ed31-4a12-9510-36b81237b87c","year":2021},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:50.976474Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:d22fd118033accc7fc9755668539ebb0471695b23deb489b2c4006aa0ff86737","observation_id":"026f45d3-d935-4b2d-95da-1b95a43a1431","resolution":{"observed_at":"2026-08-06T22:38:56.024979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:55.677714Z","title":"Vision grid transformer for document layout analysis","venue":null,"work_id":"14e85ef7-2436-4a3d-bba8-db0a1035b29d","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:51.112398Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:8fa8adcdd5350f458efb551e6cce531916333a9e055c54a25b20d37c95a86559","observation_id":"bdb503a7-3326-4655-8877-de82da18290f","resolution":{"observed_at":"2026-08-06T22:38:55.751681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:51.219412Z","title":"Fully convolutional networks for semantic segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:51.219412Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:4ad0bde1abc681acb7ad4cd52745917f90adc87f81bc483c089191236d25f26e","observation_id":"dc544755-391a-4288-92c4-ff83b9bb14cc","resolution":{"observed_at":"2026-08-06T22:38:51.219412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:55.351386Z","title":"Real-time scene text detection with differentiable binarization","venue":null,"work_id":"2afbcea2-721a-4b9f-9e40-7a71da220070","year":2020},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:51.387932Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:73e8795e0c25a04e4381db9409f7d742055fb4e53bc4d231467d5957f41cc44f","observation_id":"01ab366c-0e36-4a60-bf49-d9fff2658d86","resolution":{"observed_at":"2026-08-06T22:38:55.474643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:51.530059Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:51.530059Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:1341d9fb763234dca5acaa3426f0281d986505665b5dc4222a223490d07a1b5f","observation_id":"a0e08d6b-a1dc-47a5-97b3-d87dc9b97941","resolution":{"observed_at":"2026-08-06T22:38:51.530059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:55.081836Z","title":"Efficientandaccuratearbitrary-shapedtextdetectionwith pixel aggregation network","venue":null,"work_id":"2eda28be-fb14-42c2-a95b-8bbcdd5a3ea7","year":2019},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:51.659159Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:535e7466ecd87a4365552764456280bfd973d39c47bb8d470bda56baa700125c","observation_id":"fe67d8f9-c8f3-483c-9b5e-a9ed0e9f5986","resolution":{"observed_at":"2026-08-06T22:38:55.225749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:54.824978Z","title":"Shape robust text detection with progressive scale expansion network","venue":null,"work_id":"5cf442d5-ac3a-40cd-92c1-c43d2791d978","year":2019},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:51.821754Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:878ce208ac7f15e0bc0e271633b4d1552eb4f29c65aa95e057d0fbc46078ed5e","observation_id":"6fc7b2c6-a439-431f-ae7e-d7dd0309327d","resolution":{"observed_at":"2026-08-06T22:38:54.949428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:54.493071Z","title":"A generic solution to polygon clipping.Communications of the ACM, 35(7):56–63, 1992","venue":null,"work_id":"d93596de-d280-42db-90c6-091f05fe8d45","year":1992},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:51.965400Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:70fc8c7f37148fd7d73a70a3d3f39c3ef11361fdac7068c08194a54104af1fe7","observation_id":"edf911ce-c13f-4f4a-a370-2b9959512f2a","resolution":{"observed_at":"2026-08-06T22:38:54.663913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:54.236314Z","title":"V-net: Fully convolu- tional neural networks for volumetric medical image segmentation","venue":null,"work_id":"5ae10ec7-b0f3-4a32-98bf-5cae6c30c3c4","year":2016},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:52.125240Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:52de74a1113c86129e108cc4b5982f0080ed0edff12c9bd2a88968e0924d577d","observation_id":"395d7cfd-e4d7-463e-9f3e-02eaa991ba05","resolution":{"observed_at":"2026-08-06T22:38:54.372938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:53.950394Z","title":"Training region-based object detectors with online hard example mining","venue":null,"work_id":"5c2f03b3-a10c-471e-8248-699157304558","year":2016},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:52.274840Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:5d61e9721aea4ab3d5fbce1b77074fe2b8b121390df6b0304878dd8cb77ce653","observation_id":"09de82e0-2bbc-4445-9909-693faa3671fb","resolution":{"observed_at":"2026-08-06T22:38:54.103426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:53.661778Z","title":"Dmt-net: Deep multiple networks for low-light image enhancement based on retinex model.IEEE Access, 11:132147–132161, 2023","venue":null,"work_id":"68aa1cb4-eae4-45f5-94b0-e58c4e2252d8","year":2023},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:52.465452Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:94d0e443265f98ef73f5d22c98426fc629dc939add33a20377475b14f943a19e","observation_id":"94ac7c68-494d-4262-8737-05185d07ddc9","resolution":{"observed_at":"2026-08-06T22:38:53.812556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:53.326182Z","title":null,"venue":null,"work_id":"e37b011f-d2aa-4211-933e-180f286a1fa0","year":2019},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:52.581101Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:0df9ce695bbc9218efd647f6960376384b355cba185c52fdb460ea1b5bd9b842","observation_id":"999875d5-e24c-4821-9bb2-7c0f694d397b","resolution":{"observed_at":"2026-08-06T22:38:53.465708Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:52.729353Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:52.729353Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:47a5eff5bf474855784ec2cc99dd79840d45b9ed1cbe2316700edd7c8f2e9ddb","observation_id":"465e695b-7e91-463e-8c67-c07c5f834a6f","resolution":{"observed_at":"2026-08-06T22:38:52.729353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:38:53.081256Z","title":"A survey on curriculum learning.IEEE TPAMI, 44(9):4555–4576, 2021","venue":null,"work_id":"a0ec65f3-95ed-4bdc-badc-d5482904155e","year":2021},"citing_paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T22:38:52.885866Z"},"links":{"citing_paper":"/paper/2506.21055"},"observation_digest":"sha256:8a6ba05323190d503101f0c7fd161312b78498071473801b6775d3058399f3a2","observation_id":"052211b5-7a88-4440-8b13-39a46988d0f8","resolution":{"observed_at":"2026-08-06T22:38:53.247945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.21055","last_updated":"2025-06-26T07:09:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T22:32:11.491304Z","submitted_at":"2025-06-26T07:09:19Z","title":"Class-Agnostic Region-of-Interest Matching in Document Images"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":62},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 1 inbound Pith citation observation for arXiv:2506.21055."}