{"as_of":"2026-08-08T04:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0b97ed74639bdd430d875e7f27d9798bca47c4974c7aadd5b8070b374befa79f","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:35:18.850729Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.04983/citation-record","integrity":"/paper/2506.04983/integrity","json":"/paper/2506.04983/citation-record.json","paper":"/paper/2506.04983"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:18.712205Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.712205Z"},"links":{"citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:5c25ef875c60f0224985da08955ceb169cf8e37636d1c678a6e111ea9dee5f79","observation_id":"d84e5b36-0132-433a-9ef7-73a3368f5491","resolution":{"observed_at":"2026-08-07T10:35:18.712205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T10:35:18.715556Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.715556Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:40a91ea5cb654a8a3d4d5afab0b0a0a1c2125c2e5183f412b6e36e4ad43f4b46","observation_id":"6bf83b2e-a48c-4215-a0af-067dc447f7c5","resolution":{"observed_at":"2026-08-07T10:35:18.715556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T10:35:18.718987Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.718987Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:151cdb41935bf4b3b337fa4a2c117a1e2279aea40342c333e88024a0ee6880c2","observation_id":"cc093305-7e84-45dc-8f87-67444dbb058b","resolution":{"observed_at":"2026-08-07T10:35:18.718987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:18.722304Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.722304Z"},"links":{"citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:4460022f0ae0a06e981ec0ad1a34e2628bf5e00be001b1ed54befc98b7ed36f4","observation_id":"fb90f1e1-b9bf-4b35-a329-2e38dbdc1f89","resolution":{"observed_at":"2026-08-07T10:35:18.722304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08593","last_updated":"2024-10-11T07:42:36Z","snapshot_observed_at":"2026-08-07T08:16:37.670417Z","submitted_at":"2024-10-11T07:42:36Z","title":"VERIFIED: A Video Corpus Moment Retrieval Benchmark for Fine-Grained Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08593","snapshot_observed_at":"2026-08-07T10:35:18.725324Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.725324Z"},"links":{"cited_paper":"/paper/2410.08593","citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:92d461d90555edeacd3f6529f1b1c87fa4fb85b3e8f2cd7de1fcb94fd7c195e6","observation_id":"692e5820-f16e-441f-8b78-987d9d3936dc","resolution":{"observed_at":"2026-08-07T10:35:18.725324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:18.728423Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.728423Z"},"links":{"citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:5db97b0f945ed1b3e2460fbba5b73b4622d7cdcd66a7e0b076503a53006b1efb","observation_id":"f1f8aefa-6e75-4ddb-a7f4-b4f29d55b1bb","resolution":{"observed_at":"2026-08-07T10:35:18.728423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13753","last_updated":"2024-02-21T12:30:33Z","snapshot_observed_at":"2026-08-02T12:47:57.325302Z","submitted_at":"2024-02-21T12:30:33Z","title":"LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13753","snapshot_observed_at":"2026-08-07T10:35:18.731567Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.731567Z"},"links":{"cited_paper":"/paper/2402.13753","citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:f212ac8f804f66f81d94a255ea66b68334a1a5418a497bad0b79af374583e310","observation_id":"8323916c-5354-4581-80d9-9d0e94cfa7c0","resolution":{"observed_at":"2026-08-07T10:35:18.731567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:19.238324Z","title":null,"venue":null,"work_id":"d4c5a78e-968a-4a56-a2de-f715b6d4134c","year":2015},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.734490Z"},"links":{"citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:ecdda2c31e71d299e56efcf316dd6eeded34491681d50788b8e39f9ff3c42fe7","observation_id":"1f484c36-ab46-4e9d-bd2f-90875d639028","resolution":{"observed_at":"2026-08-07T10:35:19.241090Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:18.737180Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.737180Z"},"links":{"citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:a3dfdb51f287c4f13db677006edfe8e7507de860a4c9a2843dbc4073892a9919","observation_id":"70e534b0-ede5-4740-bcd7-10d40ea9d9d8","resolution":{"observed_at":"2026-08-07T10:35:18.737180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T10:35:18.740049Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.740049Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:481eb45bc628c7bcaef07975a9320e7daa118c58e30f341df23f61124d676318","observation_id":"86d84e25-8b1c-4e00-a23d-28b0c49b1487","resolution":{"observed_at":"2026-08-07T10:35:18.740049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:19.222076Z","title":null,"venue":null,"work_id":"f9244a8f-9869-4d0a-adf3-91aa819ed139","year":2020},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.743167Z"},"links":{"citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:b739e8de9b7ecc13b2fb0a04710be2010763d3d33699e0a6603c6e3acea2311d","observation_id":"44120cab-638a-4f32-8b1d-b6625c4b4954","resolution":{"observed_at":"2026-08-07T10:35:19.224862Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:19.213433Z","title":null,"venue":null,"work_id":"d6af7c4a-a48d-4d90-ba99-45b4dff5b7e2","year":2022},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.745903Z"},"links":{"citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:f5c4d72dcfecee145186cd342f094b75b9afb77c4fff1c66632e05d797f24998","observation_id":"4e0ac14e-64e5-454f-a330-5945d7a76fbb","resolution":{"observed_at":"2026-08-07T10:35:19.216232Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:18.748572Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.748572Z"},"links":{"citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:53da9f4f5273b11ff1cb30a6bf3ea51d6e3c44291da69787a603787bceae9d8b","observation_id":"2edea8af-6358-4836-b67b-8fd7451826b7","resolution":{"observed_at":"2026-08-07T10:35:18.748572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:19.196891Z","title":null,"venue":null,"work_id":"f45769cf-9982-4afe-a6ec-6061b170bdd4","year":2018},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.751221Z"},"links":{"citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:f401fe5f5f4c5cf9f0bef26f0c6ad89e75c72481756eddce4d2bf60e40c3c4c6","observation_id":"6c063a6d-30a1-425b-9ce7-f98e6fc2a168","resolution":{"observed_at":"2026-08-07T10:35:19.199858Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T10:35:18.754501Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.754501Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:b5199cb86f98f7b8c023bec53b74b030549bec685f03e6f067db49066b0fdefc","observation_id":"27d0473b-a613-48cc-8957-ab1f2a2084d8","resolution":{"observed_at":"2026-08-07T10:35:18.754501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:19.188113Z","title":null,"venue":null,"work_id":"b5f4389e-46ee-421f-a936-122f006b94bd","year":2020},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.757346Z"},"links":{"citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:6c29765a40f95638d05ed65f4cded94bc5f17af8c1df315d24fec30b5e1d8167","observation_id":"5580c4de-fc44-4d8e-afd0-0d20ffad5f23","resolution":{"observed_at":"2026-08-07T10:35:19.191036Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:19.178869Z","title":null,"venue":null,"work_id":"3147d746-90d8-4ae8-ae23-9bab8b907226","year":2022},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.760395Z"},"links":{"citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:234728cf68b1f451d5a5417f15bab171cf6a644e41af7d1d03e5d62d72660e3c","observation_id":"a2f35c1a-7f6e-4776-8b4f-46814d970c23","resolution":{"observed_at":"2026-08-07T10:35:19.181696Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:18.763204Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.763204Z"},"links":{"citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:2e37ae395d7f588bea74ba209fc0f2697b246531ece5fcd01d7425e87d813f76","observation_id":"649a6979-1daf-43ba-a276-18031daef767","resolution":{"observed_at":"2026-08-07T10:35:18.763204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:19.163924Z","title":null,"venue":null,"work_id":"391b4fb1-2f70-4e14-ac53-e4041e32ca36","year":2017},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.766069Z"},"links":{"citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:4a6b9cc00ac28e2541dc5449a48cf3069f59c59da10244c4d1742c777b979753","observation_id":"89ef1f9b-86be-4bea-a632-c6eb69d17a44","resolution":{"observed_at":"2026-08-07T10:35:19.166753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.01696","last_updated":"2019-05-07T21:34:05Z","snapshot_observed_at":"2026-07-06T06:59:26.080263Z","submitted_at":"2018-09-05T19:14:11Z","title":"TVQA: Localized, Compositional Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.01696","snapshot_observed_at":"2026-08-07T10:35:18.768653Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.768653Z"},"links":{"cited_paper":"/paper/1809.01696","citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:1de3a19f2540354eb2f5e90bd1e6d8b2e35abe2d14020d1e02935b1e5a10b8d5","observation_id":"ddda0886-6765-46c2-957d-95ba1f9af3bb","resolution":{"observed_at":"2026-08-07T10:35:18.768653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T10:35:18.771710Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.771710Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:0d8f77e0801f01ce25f99e7175000fd0bd372a0f01b9b556bd1b1a6c70d52b2a","observation_id":"db414071-d74d-4059-bbd8-d526f99d6b4e","resolution":{"observed_at":"2026-08-07T10:35:18.771710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-07T10:35:18.774968Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.774968Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:9b3d8da016120f34cb4db1becc51734bd2786373c567257020fac60cc6d34605","observation_id":"ae6379de-b6d5-48c2-b106-3f10132f757d","resolution":{"observed_at":"2026-08-07T10:35:18.774968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:18.778106Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.778106Z"},"links":{"citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:e64c96621513c64e9de70779a7092e9d0ea56987a05c3b4b4b4a3941c84e2212","observation_id":"c62b7654-d564-4af8-bb92-a58225cfd4cb","resolution":{"observed_at":"2026-08-07T10:35:18.778106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:19.147423Z","title":null,"venue":null,"work_id":"def45f46-40a6-4e67-a0aa-f21bbd53d297","year":2017},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.780925Z"},"links":{"citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:0ff3019b7b73e092cc2f184c533172f6449c55577473ae47039e4a6764133f2c","observation_id":"e8216c7b-6030-4433-b699-c252e2a34def","resolution":{"observed_at":"2026-08-07T10:35:19.150608Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T10:35:18.783906Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.783906Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:e0648ff6167d3902cf4a2a0d74a3b4b278067b82d7e59134c4c746ff5b572e11","observation_id":"835cf121-144c-4b1d-97ca-2f4a8bb14475","resolution":{"observed_at":"2026-08-07T10:35:18.783906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:18.786787Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.786787Z"},"links":{"citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:e39abb60cdb43c5df9dfcd7490e62389072b27609efda6f28114d9434696a0e9","observation_id":"a0549b04-a468-4022-b661-1bde09cc35bb","resolution":{"observed_at":"2026-08-07T10:35:18.786787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:18.789673Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.789673Z"},"links":{"citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:e3095618267a0e5736c4305c5f5cc9de62b220d0101a6680cb6392e579f20900","observation_id":"db2feae8-49ac-463b-abbd-36bc4592cc42","resolution":{"observed_at":"2026-08-07T10:35:18.789673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03948","last_updated":"2025-06-14T16:45:01Z","snapshot_observed_at":"2026-08-06T01:31:36.844980Z","submitted_at":"2023-07-08T10:11:29Z","title":"Reading Between the Lanes: Text VideoQA on the Road","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03948","snapshot_observed_at":"2026-08-07T10:35:18.792524Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.792524Z"},"links":{"cited_paper":"/paper/2307.03948","citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:1db074b9373ac3bf29d501d0c71eb245a245ebac7cb1325c4bc183c3d9e781ed","observation_id":"96e8a43c-5a05-4d4e-a631-db2b19611c37","resolution":{"observed_at":"2026-08-07T10:35:18.792524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T10:35:18.795639Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.795639Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:ef5772a3c75b4acff0942f8188c88b65ee16116a68948446c2af660d8d6dfd7c","observation_id":"05c341f4-66da-4e22-a021-331cb3888233","resolution":{"observed_at":"2026-08-07T10:35:18.795639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1601.07140","last_updated":"2016-06-19T23:52:14Z","snapshot_observed_at":"2026-07-06T04:44:09.937735Z","submitted_at":"2016-01-26T19:30:34Z","title":"COCO-Text: Dataset and Benchmark for Text Detection and Recognition in Natural Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1601.07140","snapshot_observed_at":"2026-08-07T10:35:18.799068Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.799068Z"},"links":{"cited_paper":"/paper/1601.07140","citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:388e72841585dc929eacf487dcaea0a18703b13ee4d2138c5c700b5ad87a0876","observation_id":"9c75f9be-642d-4630-9ee1-dfe1a9b78f60","resolution":{"observed_at":"2026-08-07T10:35:18.799068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T10:35:18.802966Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.802966Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:cb916fb27d990b636c7db58dd18ee7f8060672c654a96ccbe8781674a8ee53fa","observation_id":"680c6ada-9cf1-4cf4-91f0-e2489beda7c4","resolution":{"observed_at":"2026-08-07T10:35:18.802966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:19.124350Z","title":null,"venue":null,"work_id":"4c53aef3-2fe9-4c43-a23e-9193395f947e","year":2017},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.805735Z"},"links":{"citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:8865c080ff94a773ad9f21abb20bc35c287b3425e76703291b6836e0b6a53e4a","observation_id":"360ab4bf-a420-4bd0-96b6-52d94ba8acea","resolution":{"observed_at":"2026-08-07T10:35:19.127122Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:18.808585Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.808585Z"},"links":{"citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:57bc780332e2668821882b3d163b87bee314b49aad48f578193ded89e4930f6f","observation_id":"db80d668-d646-4277-a99d-17adbb856bde","resolution":{"observed_at":"2026-08-07T10:35:18.808585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:18.812430Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.812430Z"},"links":{"citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:2b2fa2ebbdf92ba18c0ed77437acbf279963bcc43e30aafb36c92fb70d6addc8","observation_id":"3d99a1c4-a845-44b1-b4af-e6847fd32f22","resolution":{"observed_at":"2026-08-07T10:35:18.812430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:19.100972Z","title":null,"venue":null,"work_id":"affcb787-f2b9-44f9-b331-cbb36187ebb7","year":2021},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.815479Z"},"links":{"citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:14a85f08ff8fc1957bc601630d0911aa55f4de90469d93466bd89aa42dfa9ea1","observation_id":"8cf51cf3-8f4e-4f4b-a8ee-f94c685ffb68","resolution":{"observed_at":"2026-08-07T10:35:19.104244Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-07T10:35:18.818281Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.818281Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:9ee4c3047ce401e3c56936e036897277c0ca0c8327edb3a8c7130d7f4bc854e6","observation_id":"90256300-b541-4ad1-a4c1-06973ecb44f1","resolution":{"observed_at":"2026-08-07T10:35:18.818281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T10:35:18.821165Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.821165Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:a1feea303e049c69082edd2fb62bf906d9a4b1f43571ba01e450199bf99dc5d5","observation_id":"d95a24a7-32b9-44fe-bb84-81e1294b2af8","resolution":{"observed_at":"2026-08-07T10:35:18.821165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:18.824624Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.824624Z"},"links":{"citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:2296b85fa0fdbef34b73461a098e49b37f7973110974b1ec14426cea696da29f","observation_id":"1f12a3a1-cb80-4eb9-9e94-ba6a2310e420","resolution":{"observed_at":"2026-08-07T10:35:18.824624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:18.827589Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.827589Z"},"links":{"citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:c46b81561a407c1ed643a7c12c03358713cab5fd9228bfce97bca6a95e0f6c28","observation_id":"a953a613-48c1-4045-903e-2287e95efbb0","resolution":{"observed_at":"2026-08-07T10:35:18.827589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:19.078015Z","title":null,"venue":null,"work_id":"ba335c87-ed1a-4783-b952-ae84862ae694","year":2017},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.830401Z"},"links":{"citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:24da70e13bf7dd703ea8d14cdde0a32750dc05470685cf5fb975317c663954ac","observation_id":"6eae8b80-451a-4cc6-ab7d-9268c2002e87","resolution":{"observed_at":"2026-08-07T10:35:19.080995Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15343","snapshot_observed_at":"2026-08-07T10:35:18.833261Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.833261Z"},"links":{"cited_paper":"/paper/2303.15343","citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:8031dcc8404e7078be94b8555eac4db31e12b2c3efc6b554f9c30f81d45548d4","observation_id":"414c1749-d341-4e53-997f-cd0c64927358","resolution":{"observed_at":"2026-08-07T10:35:18.833261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T10:35:18.836228Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.836228Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:2e641d7e74f4af225e79575f071218bd55aa4dd8c5f1a1d1aa84145c91cda6b7","observation_id":"b10c4db0-dc68-4031-b0c2-9d98e407ecf4","resolution":{"observed_at":"2026-08-07T10:35:18.836228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:19.068397Z","title":null,"venue":null,"work_id":"e5934c1f-444a-4618-a284-a9b107c9faa4","year":2022},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.841905Z"},"links":{"citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:69998e0785777fa0f0e4188b5fe1e0e315bca19826d69a4fe41a6a1d21c0d419","observation_id":"a58274db-6f1a-4235-bbbd-59ccb7aaae56","resolution":{"observed_at":"2026-08-07T10:35:19.071198Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:19.058021Z","title":null,"venue":null,"work_id":"6a2ffe5c-a912-43e6-b5d3-8f54cc33cda4","year":2016},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.844911Z"},"links":{"citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:5c2c2ff44785f854c92679f2aaab2743c554c4fdfb22675cd6178c4cb1d1ced1","observation_id":"414cff74-895b-47a4-8848-bdd2979f58b8","resolution":{"observed_at":"2026-08-07T10:35:19.061792Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:18.847607Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.847607Z"},"links":{"citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:a33982099d8e684fea76ce34d075ae22792ddfa2750a9dec4a20da988e1bc93f","observation_id":"cb6284ac-2f4d-421d-8026-4ec1b428979a","resolution":{"observed_at":"2026-08-07T10:35:18.847607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:35:18.850729Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.850729Z"},"links":{"citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:c8278479de30c5cd16686f077f1ed6b79c749d9ce3e3fccb73249bf77ef1e613","observation_id":"d04e1152-177c-4677-9969-5d520847b655","resolution":{"observed_at":"2026-08-07T10:35:18.850729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T10:26:41.915128Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2506.04983."}