{"as_of":"2026-08-08T14:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9a29890e1f0ea90cdb1cfe96f3b3f71f59d976021bded1898136a376b72fbc91","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:09:38.557854Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T00:50:22.839005Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:09:57.560157Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"cited_work":{"arxiv_id":"2506.11820","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11820","snapshot_observed_at":"2026-07-04T16:09:57.560157Z","title":"arXiv preprint arXiv:2506.11820 , year=","venue":null,"work_id":"b21ffee2-510f-40d8-a127-398231853315","year":2025},"citing_paper":{"arxiv_id":"2605.02035","last_updated":"2026-05-26T13:27:57Z","snapshot_observed_at":"2026-08-01T16:17:19.756210Z","submitted_at":"2026-05-03T19:55:06Z","title":"VIDA: A dataset for Visually Dependent Ambiguity in Multimodal Machine Translation","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-05-08T19:34:02.860270Z"},"links":{"cited_paper":"/paper/2506.11820","citing_paper":"/paper/2605.02035"},"observation_digest":"sha256:270d5cd29f3f5548e9fed2397119419c49b0254cecbe06c76e901ec37976c34a","observation_id":"959eaf23-72d1-44a7-b8c7-c507cf6f1cbe","resolution":{"observed_at":"2026-05-09T05:50:25.683678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"cited_work":{"arxiv_id":"2506.11820","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11820","snapshot_observed_at":"2026-07-04T16:09:57.560157Z","title":"arXiv preprint arXiv:2506.11820 , year=","venue":null,"work_id":"b21ffee2-510f-40d8-a127-398231853315","year":2025},"citing_paper":{"arxiv_id":"2606.24333","last_updated":"2026-06-23T09:11:24Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T09:11:24Z","title":"UniTranslator: A Unified Multi-modal Framework for End-to-end In-Image Machine Translation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-26T00:50:22.839005Z"},"links":{"cited_paper":"/paper/2506.11820","citing_paper":"/paper/2606.24333"},"observation_digest":"sha256:f3e8aa188a49785dcd506042b1176d03a11df2cee83edec7448fcc3dd0b11780","observation_id":"29de0f1f-ec21-48f3-bb35-39b29add18b7","resolution":{"observed_at":"2026-07-04T16:09:57.561630Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.11820/citation-record","integrity":"/paper/2506.11820/integrity","json":"/paper/2506.11820/citation-record.json","paper":"/paper/2506.11820"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:42.431042Z","title":null,"venue":null,"work_id":"eed9517f-6324-4b25-b4fe-08cec11e5482","year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:34.190461Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:53e59fc7418aaf713620a03e867736428520e4b2980640d8eee5f8e336ce57df","observation_id":"a07cb292-aab3-4548-b423-965549ca451a","resolution":{"observed_at":"2026-08-07T04:09:42.473118Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:42.321180Z","title":null,"venue":null,"work_id":"9603557a-afa5-47c5-964a-0fa2f8e2a23a","year":2025},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:34.274201Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:1cd1b886039490868474bb98bb98f74376200c277892675da689073916f4e2a7","observation_id":"a902591a-d0ed-43fa-82af-d9f9dacb2089","resolution":{"observed_at":"2026-08-07T04:09:42.364665Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:42.208585Z","title":null,"venue":null,"work_id":"29e7159c-a90d-412c-9190-12aa85df6aed","year":2020},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:34.368938Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:9877a2977b36db78835f161679d6a1302608796e97a17127c0b8baa1944476c7","observation_id":"6465ca04-a3de-47c9-8cea-a9f255bb5518","resolution":{"observed_at":"2026-08-07T04:09:42.252074Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:42.070205Z","title":null,"venue":null,"work_id":"ac4ee13a-4733-40d9-a8ce-0f47ced35409","year":2025},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:34.456818Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:04b5737b014d2d31b667bdbf258166f375beea7e197dbf51ecf38da594d5a083","observation_id":"7b8dc7da-69e9-4c9d-b52a-a27c1c825e7b","resolution":{"observed_at":"2026-08-07T04:09:42.147588Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T04:09:34.536244Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:34.536244Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:f57a33c201499d280649be7f3b46cebe03e6b79334ee164fa1eec2d9cc978b81","observation_id":"da00d981-6080-4a81-afd3-fd9404a8f77f","resolution":{"observed_at":"2026-08-07T04:09:34.536244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T04:09:34.620101Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:34.620101Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:ea9bd40acb4000401214ff4566a46ce3f72830ae5bbfb5c233931122ad8f4c52","observation_id":"9ce7deb8-c1b8-41d5-83cd-fa0285ca6a55","resolution":{"observed_at":"2026-08-07T04:09:34.620101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T04:09:34.693712Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:34.693712Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:5228e8d2bbc6c5c77585fe3284a4a7243bb1a4cbeaf9edddaaa9156e30deef32","observation_id":"54ad94a7-f6da-43a5-9a6e-d0fbeafe9033","resolution":{"observed_at":"2026-08-07T04:09:34.693712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:41.814989Z","title":null,"venue":null,"work_id":"4eb9c2c5-ea30-4005-9f35-b9cdfb6876ee","year":2025},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:34.802169Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:376ad3de322a3534500510e7a9146938ea45c9f01041ba258366efd41eabb708","observation_id":"c8217aed-9829-4158-ad9c-3f61f4b3c1d8","resolution":{"observed_at":"2026-08-07T04:09:41.938815Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-07T04:09:34.888015Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:34.888015Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:7708c154cc684158a9625fa25e42cfc90419a1032b52fa1bfc89adc22a8a65c0","observation_id":"beae5aa9-804d-47ce-85fd-bbc5d049e92e","resolution":{"observed_at":"2026-08-07T04:09:34.888015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:41.596695Z","title":null,"venue":null,"work_id":"bf67ee49-5c71-4b82-aff2-df673b98784a","year":2025},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:34.981820Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:730c1c83d06c73ea22ab45eb21c11e83a2474eb98badedd7032792e85f1aea6b","observation_id":"a5ccf9eb-4b48-42f9-b2d2-c439bca80c13","resolution":{"observed_at":"2026-08-07T04:09:41.704019Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-05T03:42:54.599829Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16420","snapshot_observed_at":"2026-08-07T04:09:35.068668Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:35.068668Z"},"links":{"cited_paper":"/paper/2401.16420","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:646005dc85f2319b810d7aad8cba7b9001995ec186e9c992cb1e4d31723d118d","observation_id":"a489ee83-af0a-4b92-92a4-dc0270172f2d","resolution":{"observed_at":"2026-08-07T04:09:35.068668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-07T17:13:10.057242Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-07T04:09:35.164573Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:35.164573Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:a01764ada532f911cb11b76ebd8b5fa3347ad602c0b67e0db339fbe0cae9a905","observation_id":"c3a40e3e-c8df-4cce-9e1d-0f4f7080c97f","resolution":{"observed_at":"2026-08-07T04:09:35.164573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T04:09:35.268346Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:35.268346Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:c72919dc501bd2bb9aa0d08edbee52cc2e22a4913e5f40f96dd3071637c645d0","observation_id":"5c7fcaa6-3b2c-45da-a5e6-c1a0f2802610","resolution":{"observed_at":"2026-08-07T04:09:35.268346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02333","last_updated":"2024-07-02T15:01:55Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T15:01:55Z","title":"Why do LLaVA Vision-Language Models Reply to Images in English?","version":1},"cited_work":{"arxiv_id":"2407.02333","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.02333","snapshot_observed_at":"2026-08-07T04:09:39.159183Z","title":"Why do LLaVA Vision-Language Models Reply to Images in English?","venue":"cs.CL","work_id":"452ff4be-7186-4259-8e5e-1f6cabcd2d15","year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:35.375611Z"},"links":{"cited_paper":"/paper/2407.02333","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:64d409e21c97a52eff74848489f956d48a3da64381b00d268265e93d19ac9157","observation_id":"5a50f67f-5712-4359-b53e-c6e6834f46ea","resolution":{"observed_at":"2026-08-07T04:09:39.218598Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:41.397024Z","title":null,"venue":null,"work_id":"c52bfa26-18a9-4f81-8372-41b1c934dc80","year":null},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:35.482280Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:f1f56627b64921dcc459528866d019cb4beff14a9aee3da1c6bb2988a024959d","observation_id":"fdb6b414-0240-4ad5-b963-8bc1245d4bea","resolution":{"observed_at":"2026-08-07T04:09:41.519045Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:41.162030Z","title":null,"venue":null,"work_id":"b3d2ee18-aed1-4873-84b5-87e3c8b0b22a","year":null},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:35.712901Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:946fc8c7c33c276268060f763a99a69569d81902ff8fc48a757b24e022270100","observation_id":"021f66d7-dbf3-40cf-962b-d4020be13807","resolution":{"observed_at":"2026-08-07T04:09:41.265749Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:40.930091Z","title":null,"venue":null,"work_id":"e5db079b-fdb7-4231-b46e-f5fc84c03f1a","year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:35.896344Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:bc63062dd9c0eb3f5f1c4227d0226c02e84df803c907cce3b425567a30bd0fd9","observation_id":"85313ac1-7066-42a3-851f-1d431dd08420","resolution":{"observed_at":"2026-08-07T04:09:41.033037Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17415","last_updated":"2023-06-02T12:38:37Z","snapshot_observed_at":"2026-07-06T15:34:16.800916Z","submitted_at":"2023-05-27T08:41:18Z","title":"Exploring Better Text Image Translation with Multimodal Codebook","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17415","snapshot_observed_at":"2026-08-07T04:09:35.989987Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:35.989987Z"},"links":{"cited_paper":"/paper/2305.17415","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:5de5d8e6a997e764e48ebe23233faee1ee9fe9537a941472c9558dab25690d2c","observation_id":"9bf2ad5b-2a7a-4c85-9c6b-1ca2c814fe70","resolution":{"observed_at":"2026-08-07T04:09:35.989987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T04:09:36.118268Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:36.118268Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:a53c9fbdb9dd8854366d3d070f117ff598a672a9a3fc83e78bf6801cce161d85","observation_id":"1d7ee12b-bb86-405d-a86f-87fd3b061468","resolution":{"observed_at":"2026-08-07T04:09:36.118268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07147","last_updated":"2024-12-16T09:28:53Z","snapshot_observed_at":"2026-08-07T05:02:51.697949Z","submitted_at":"2024-12-10T03:12:35Z","title":"MIT-10M: A Large Scale Parallel Corpus of Multilingual Image Translation","version":2},"cited_work":{"arxiv_id":"2412.07147","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.07147","snapshot_observed_at":"2026-08-07T04:09:38.805613Z","title":"MIT-10M: A Large Scale Parallel Corpus of Multilingual Image Translation","venue":"cs.CV","work_id":"219d8931-abaa-41d6-970a-c75e2229a971","year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:36.200053Z"},"links":{"cited_paper":"/paper/2412.07147","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:74f78680dd386a0ca3d6f7c8436d0d18355fcf66b6b9e625dcaf635aa65d88c8","observation_id":"7bc98be5-2f6d-41db-a796-33cbe7da28d4","resolution":{"observed_at":"2026-08-07T04:09:38.856996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:40.769488Z","title":null,"venue":null,"work_id":"a16f17bf-2052-4031-af88-0d8600586393","year":2025},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:36.309154Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:7c6a7a8cbcb3f030ec96aba98e913909565c2b9b07b9bcdbcf0ef8f46309d364","observation_id":"c6021510-60ba-4509-a864-9b08541391ce","resolution":{"observed_at":"2026-08-07T04:09:40.859384Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:36.415839Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:36.415839Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:b9636f2dab02e67d75d8519a1b7d9bc7ba07d1a3c67f3206e5ef4e7a4a104513","observation_id":"0557a70b-1a8b-4421-ac70-5e653519dacc","resolution":{"observed_at":"2026-08-07T04:09:36.415839Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T04:09:36.524679Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:36.524679Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:97cf091ceddc6777f0c15b7698dc919f6df58b217188cf313593079a88fb4273","observation_id":"a68d240e-463e-4c1a-bc8b-b2d08de45c9c","resolution":{"observed_at":"2026-08-07T04:09:36.524679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-07T04:09:36.610381Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:36.610381Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:adc6f8e67155ea61e59efbe24067c2dfa9e32066a04a9f5b8cf90ad09ea71034","observation_id":"0fb004d3-12dd-46a7-a6ed-78a076c9ae56","resolution":{"observed_at":"2026-08-07T04:09:36.610381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:40.589451Z","title":null,"venue":null,"work_id":"ec77f289-c367-47d0-9cd9-6e416499262d","year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:36.753882Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:2fffb1ded82c230c46def538d8fd4341364682ae6815ee7a57ea0ea190ea12df","observation_id":"091fc455-d1bf-4298-bc20-200ef325884a","resolution":{"observed_at":"2026-08-07T04:09:40.660349Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:40.411488Z","title":null,"venue":null,"work_id":"6c4bc81a-d2d8-420e-ab07-b70eafe7810e","year":2025},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:36.828092Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:50f7785cbcbf17407f965ab6c76c2d4f33b6ec7027f95068a0f5f54069027229","observation_id":"16f63c40-6054-47f8-8093-4e9e5391bc84","resolution":{"observed_at":"2026-08-07T04:09:40.470286Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:40.282405Z","title":null,"venue":null,"work_id":"f972e72d-0646-47e9-9cdd-effbcbbf530e","year":2025},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:36.958398Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:9c751dbf30e258955ef36104d2ccd6617df5f28f5925276fe3fc809fbbd5ac2f","observation_id":"93aa56c0-dd99-47e5-bd64-6cd2a0fa9677","resolution":{"observed_at":"2026-08-07T04:09:40.347547Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:40.137958Z","title":null,"venue":null,"work_id":"1ceb48e8-b5a7-4afb-8b97-0136da21d94b","year":2025},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:37.105600Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:8d12892515ff9d3d2b57926488d932eec37d9aa90d0e1ecec95c57ac6f5e0790","observation_id":"af145a36-0bd4-4174-8123-b1f8c71a6dd9","resolution":{"observed_at":"2026-08-07T04:09:40.184971Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T04:09:37.234227Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:37.234227Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:c81d6f86b1ffc7249130e945261be035ab29a34e51f112548bbe3aa369dbb695","observation_id":"c436a5a2-c01f-4921-a1a4-93e42c68ecb2","resolution":{"observed_at":"2026-08-07T04:09:37.234227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:39.969012Z","title":null,"venue":null,"work_id":"b28e7900-986a-4393-adc4-dd2536efda6f","year":2025},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:37.356553Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:2d4bf1af3751a70c77a34444a9bd34d649afc1ba5bf6b61d2d1977d3bc1ab507","observation_id":"27a7eb21-c56a-44ab-8bee-7ce0b70a4792","resolution":{"observed_at":"2026-08-07T04:09:40.038387Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11432","last_updated":"2024-06-17T11:37:48Z","snapshot_observed_at":"2026-07-06T18:32:06.826381Z","submitted_at":"2024-06-17T11:37:48Z","title":"AnyTrans: Translate AnyText in the Image with Large Scale Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11432","snapshot_observed_at":"2026-08-07T04:09:37.454148Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:37.454148Z"},"links":{"cited_paper":"/paper/2406.11432","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:b54b68dbfc9b6abe9d0f89df48f8328b71cf221a41456a2c6f1b4bb2226e756b","observation_id":"f6425688-e5e3-4c1d-ac57-b5a1b924ea92","resolution":{"observed_at":"2026-08-07T04:09:37.454148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:39.837000Z","title":null,"venue":null,"work_id":"fa204109-2434-4c06-8d25-47683f947a7b","year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:37.579741Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:5d7de9a15f1e429cd9ba480faa64303198705c13cdbdf4e3ba6cf6078ab1443b","observation_id":"e49542db-372d-439b-b646-7c932d159184","resolution":{"observed_at":"2026-08-07T04:09:39.890062Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:39.686688Z","title":null,"venue":null,"work_id":"a1a6c51e-a9fd-4c59-8b02-3f6947d6e5db","year":2025},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:37.753785Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:f69a59ad1d12bb92d5ac489187e64205e1af97ba7c5fc4663cfa6106b8d6074d","observation_id":"352fe44c-dc6f-4756-849e-989a9caf09d1","resolution":{"observed_at":"2026-08-07T04:09:39.763487Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:39.538557Z","title":null,"venue":null,"work_id":"f4dadc44-26d3-40fe-8851-8a88d6f46f2e","year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:37.875638Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:94cb1dc6e6f8c29695952047fc19ecfdba7b5f5519fe9db841f8ba1eefd5be3c","observation_id":"3a25f781-e255-471e-b826-4df209a5197e","resolution":{"observed_at":"2026-08-07T04:09:39.625251Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:39.408513Z","title":null,"venue":null,"work_id":"06591893-ea43-4c82-9e7a-e2ca7f32fd9a","year":2008},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:38.008146Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:d0be681788427bd70a7f21e94791c7fcb53168bdf95a4005517360fc8bb4fe0d","observation_id":"8eaa5ac8-6fba-48bd-877f-4f8836538ceb","resolution":{"observed_at":"2026-08-07T04:09:39.468213Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:09:38.151001Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:38.151001Z"},"links":{"citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:d848de769e0a4e34a6063a8d9f541d4791150dd7fe3a541aa579e068796603ad","observation_id":"6c3d87d5-6e49-4bb3-b4f6-44b90f62adb2","resolution":{"observed_at":"2026-08-07T04:09:38.151001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-07T04:09:38.305643Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:38.305643Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:fd214aca033b7afd80fae8dcb9be60751fb7169ca215c74e03ee35e5d75460c6","observation_id":"00cb081d-4089-4d71-9413-23de75b09525","resolution":{"observed_at":"2026-08-07T04:09:38.305643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T04:09:38.380048Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:38.380048Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:dda0e61ee220c3572749c5aaa91adac74e18516b77b80ec9b6fb8b29b0a9f370","observation_id":"666eba29-f95c-49a0-9801-dba863f9e9b1","resolution":{"observed_at":"2026-08-07T04:09:38.380048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02210","last_updated":"2024-12-10T05:01:33Z","snapshot_observed_at":"2026-07-06T20:00:47.730252Z","submitted_at":"2024-12-03T07:03:25Z","title":"CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02210","snapshot_observed_at":"2026-08-07T04:09:38.470496Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:38.470496Z"},"links":{"cited_paper":"/paper/2412.02210","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:7935ae2140ce0c76341ae1840c13bcad5495d83ec433446117a554ad713e5d9d","observation_id":"c4292ea1-2568-4750-ae9c-1109fad454ab","resolution":{"observed_at":"2026-08-07T04:09:38.470496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T04:09:38.557854Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:38.557854Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:b76958d145c0098107595b7caf641e5971d6d7069499933106ba447e00ac6644","observation_id":"f36073cc-ae6b-47bb-a1c1-cd5d021c379b","resolution":{"observed_at":"2026-08-07T04:09:38.557854Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.09095","last_updated":"2021-01-27T03:39:20Z","snapshot_observed_at":"2026-07-06T09:13:34.882593Z","submitted_at":"2020-04-20T07:19:22Z","title":"The State and Fate of Linguistic Diversity and Inclusion in the NLP World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.09095","snapshot_observed_at":"2026-08-07T04:09:35.593856Z","title":"arXiv preprint arXiv:2004.09095(2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:35.593856Z"},"links":{"cited_paper":"/paper/2004.09095","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:6177badb135374da05cd7e5f5cc3b8fb04e737181d8ccb324b799cd3a87c4d5a","observation_id":"e2b7ff45-9a2c-4c19-9edb-b4fa4e9b5391","resolution":{"observed_at":"2026-08-07T04:09:35.593856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20420","last_updated":"2025-02-27T07:14:31Z","snapshot_observed_at":"2026-08-08T08:59:05.755654Z","submitted_at":"2025-02-27T07:14:31Z","title":"Chitranuvad: Adapting Multi-Lingual LLMs for Multimodal Translation","version":1},"cited_work":{"arxiv_id":"2502.20420","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.20420","snapshot_observed_at":"2026-08-07T04:09:38.985231Z","title":"Chitranuvad: Adapting Multi-Lingual LLMs for Multimodal Translation","venue":"cs.CL","work_id":"738c18cd-e8e5-4401-ab34-4d7011f26d61","year":2025},"citing_paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T04:09:35.787476Z"},"links":{"cited_paper":"/paper/2502.20420","citing_paper":"/paper/2506.11820"},"observation_digest":"sha256:eb17d515dd5f7d5043bb13d5783b57a2596accf958f28163ddb93ed26924a05a","observation_id":"5b8334f9-b787-4344-8067-57e8e8af5110","resolution":{"observed_at":"2026-08-07T04:09:39.064229Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.11820","last_updated":"2025-06-13T14:23:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T04:01:34.908967Z","submitted_at":"2025-06-13T14:23:38Z","title":"Rethinking Multilingual Vision-Language Translation: Dataset, Evaluation, and Adaptation"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":37,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 2 inbound Pith citation observations for arXiv:2506.11820."}