{"as_of":"2026-07-31T17:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5a7a991c39dba0fe177f7baefe5b2327766c04ece1fd4d85ac0eade26b240c16","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-05T12:25:00.027624Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-31T06:34:12.847434+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.18347/citation-record","integrity":"/paper/2604.18347/integrity","json":"/paper/2604.18347/citation-record.json","paper":"/paper/2604.18347"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:20d72cd7d3330c9616e08f60c98927120a4630b8a65660404c53d8e8fb7cb877","observation_id":"a7fbb15e-dfac-4b9f-af9a-0d9ee1cb9692","resolution":{"observed_at":"2026-07-05T12:30:59.863814Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.083607Z","title":"In: NeurIPS (2022)","venue":null,"work_id":"1eb6d40f-a1a1-467e-a5bf-7c7030a8d772","year":2022},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:09949659cd957e7e7c61f6af3f189e4dc16b06fc0417b8869396fdc7bb16264e","observation_id":"4ddf72b3-be2c-4154-b12e-3fc7a1ffd9dd","resolution":{"observed_at":"2026-07-05T12:31:00.084671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.064213Z","title":"In: ICCV (2015)","venue":null,"work_id":"99acb0c1-328a-4fe9-b3c3-f13f65f38959","year":2015},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:af59d6d14f40664e4acc1c5a3cfa479af6a3f6f37a99bfb1d334805f01eb3e9f","observation_id":"9d3da8ac-99af-416d-8311-6487b6343f01","resolution":{"observed_at":"2026-07-05T12:31:00.065482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16923","last_updated":"2020-07-24T02:55:13Z","snapshot_observed_at":"2026-07-06T09:34:09.418067Z","submitted_at":"2020-06-24T06:41:32Z","title":"Large image datasets: A pyrrhic win for computer vision?","version":2},"cited_work":{"arxiv_id":"2006.16923","doi":"10.48550/arxiv.2006.16923","metadata_source":"pith","pith_arxiv_id":"2006.16923","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Large image datasets: A pyrrhic win for computer vision?","venue":"cs.CY","work_id":"0a9c3996-deb2-4052-a1dd-52fdfa493597","year":2020},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"cited_paper":"/paper/2006.16923","citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:52b7306457b347b395ed5bc8ef5fdc74bfc84cd8c147738027abd099bd538ef4","observation_id":"eeeac37f-c9d2-4509-9c68-e29fb4d96c49","resolution":{"observed_at":"2026-07-05T12:30:59.838782Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.059042Z","title":"FAccT (2021)","venue":null,"work_id":"2bd3e67e-f2bb-4bce-b13a-5893efaa2ae0","year":2021},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:b28f7b407b4b3acb97559d596b72dea82520d62f4daacb970dd8c6b4aafa473e","observation_id":"9e3d1856-9a88-43b6-a4e0-a7055de32dbc","resolution":{"observed_at":"2026-07-05T12:31:00.060241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:f6c2e2c19b0bca71c873e2fc2b7ed8551a71ebc049b098911fc43467c33b2c3e","observation_id":"c1bb11a9-ec64-4e68-b0c1-759f78444bee","resolution":{"observed_at":"2026-07-05T12:30:59.865337Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.070429Z","title":"In: ACL (2020)","venue":null,"work_id":"ce7e6223-397e-4b7a-8394-a530d9212264","year":2020},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:6a423f037af94f0a9b620e121fa024b810a9d329ec3b0064b62223c42fba01c4","observation_id":"9211162a-1a61-40cb-88cc-61186fcf42aa","resolution":{"observed_at":"2026-07-05T12:31:00.071541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02116","last_updated":"2020-04-08T01:02:17Z","snapshot_observed_at":"2026-07-06T08:34:58.548831Z","submitted_at":"2019-11-05T22:42:00Z","title":"Unsupervised Cross-lingual Representation Learning at Scale","version":2},"cited_work":{"arxiv_id":"1911.02116","doi":"10.48550/arxiv.1911.02116","metadata_source":"pith","pith_arxiv_id":"1911.02116","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Unsupervised Cross-lingual Representation Learning at Scale","venue":"cs.CL","work_id":"32df83f5-69ea-418b-9a8d-03c2d6695b80","year":2019},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"cited_paper":"/paper/1911.02116","citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:88e92214aa3f8c0c0925a34ff36d58b5a8f9f8e77aafae1ba86fc1ff4289dee2","observation_id":"27315e54-13b5-49ba-a186-1163096095af","resolution":{"observed_at":"2026-07-05T12:30:59.858791Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.073617Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2025)","venue":null,"work_id":"25eab5b3-6a17-4503-b70e-7de5bc9fe4cd","year":2025},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:8a8dd92576f555fe0b562379562e821b988a69926338ec7e711d3cca4d56dc35","observation_id":"7d957ac8-78dc-4a30-8014-452a1a00af34","resolution":{"observed_at":"2026-07-05T12:31:00.075442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.086113Z","title":"In: Proceedings of the 32nd ACM International Conference on Multimedia","venue":null,"work_id":"fd4b8e50-3aaa-4ef8-a597-0e282d0efd09","year":2024},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:3cec6a97b62ca072b3fade1828bb5412660ff023940c588607587389f413677f","observation_id":"f4148607-ac8e-42da-aecf-855cf5ebc93c","resolution":{"observed_at":"2026-07-05T12:31:00.087228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.074181Z","title":"In: VL@ACL (2016)","venue":null,"work_id":"6d65a8f2-6474-4ca5-8e6a-abec00880e82","year":2016},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:7e3538d780f0625bb551a25c8670e55289f056b67a5bad8eb5630f3c55e88292","observation_id":"685df082-9469-422b-aebf-c72460905ac7","resolution":{"observed_at":"2026-07-05T12:31:00.075239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.030590Z","title":"In: Advances in Neural Information Processing Systems (NeurIPS) Datasets and Benchmarks Track (2023)","venue":null,"work_id":"2c5a688a-9d5d-4500-86d0-5766be5ad014","year":2023},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:e80263a6f2e35945da1f6f1fbf00b0b9b4e10cb76e5cf9aef638daa92e46347c","observation_id":"78306f1d-bec3-4c61-a8a4-b7a8f1880235","resolution":{"observed_at":"2026-07-05T12:31:00.032667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.079728Z","title":"HuggingFace model card (2024)","venue":null,"work_id":"ccaa68e2-3b7a-4252-92cd-b4b93cea0f89","year":2024},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:1f6ed06ea3e276cde856ea181094bea48f548da630e6d510e4e45c0568f2a809","observation_id":"8180e686-f5c9-49d7-a093-2c32cc399342","resolution":{"observed_at":"2026-07-05T12:31:00.081130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.062295Z","title":"International Journal of Computer Vision127(4), 398–414 (2019)","venue":null,"work_id":"a776e3c5-fa4f-4378-9da6-da207f5c0509","year":2019},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:6f21ab0d22b4507bfffecc2b6d69530b912cbc762bcba7a40b7ec37f687e8eb5","observation_id":"90e626c7-1cca-4fb3-896f-84e1c628444a","resolution":{"observed_at":"2026-07-05T12:31:00.063505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:38654bda229c8a3a6bd7381973d70a1e1cf6d2ab79d510e77256275e64efafe7","observation_id":"350d19db-9371-4ad9-85b8-7b0cbd0dc311","resolution":{"observed_at":"2026-07-05T12:30:59.884326Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1348/000711006x126600","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:57:06.762138Z","title":"British Journal of Mathematical and Statistical Psychology61(1), 29–48 (2008).https://doi.org/10.1348/000711006X126600","venue":null,"work_id":"17937be2-b042-44ec-8216-581258bcdfef","year":2008},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:dc5a81a0a102a23505bc69c53c8f9fe0a61a1953a86e03d2be77b4cb62afee50","observation_id":"de0d56ca-f179-4383-a139-194fa10790b3","resolution":{"observed_at":"2026-07-05T12:30:59.740528Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.043406Z","title":"HuggingFace dataset (2024)","venue":null,"work_id":"6e0a6f47-3211-4b4b-9726-c1b8fb3c8226","year":2024},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:4e2a3c2e128e2d510b41bf90ad170108915ec321ebbff8729389dcb1ebd1a620","observation_id":"5a1a2968-a008-47d7-ace4-b3c050293a5e","resolution":{"observed_at":"2026-07-05T12:31:00.044550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.068134Z","title":"HuggingFace dataset (2024)","venue":null,"work_id":"123efe0e-f2b0-4111-8c1e-92c20b4a2dae","year":2024},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:7f1a0b43137d6c4741a466c394a797e52833640043626aaa3fe5f51896389fc1","observation_id":"168b4f8d-16d6-4e14-8899-0ac10eb7b417","resolution":{"observed_at":"2026-07-05T12:31:00.069378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.072101Z","title":"HuggingFace dataset (2024) 16 Baiamonte et al","venue":null,"work_id":"601758f3-1216-4b6b-8585-ed38cab4e308","year":2024},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:37fd2ca3690e429758b29abb4f99c2e7d600cca3129e83145de475dd40861163","observation_id":"4cc32fc1-b8a9-4a81-9ec4-8fcf327f3c41","resolution":{"observed_at":"2026-07-05T12:31:00.073295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.075759Z","title":"HuggingFace model card (2024)","venue":null,"work_id":"a88a3eb8-88e5-483a-b0c2-fdd881dcb386","year":2024},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:d6844816847c872440c426aea97ea1fa7a547901ca41b66f360fd61e53028e62","observation_id":"34d3d6d9-f05c-4a84-b9d1-87f25b5b1fdc","resolution":{"observed_at":"2026-07-05T12:31:00.076886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.050595Z","title":"In: ECCV (2016)","venue":null,"work_id":"7b678997-0803-4c61-8c59-6119d965d1aa","year":2016},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:8143ebe10ca77c06314398bb9cdac1c784b48434838871ea75d8f7778a8a66f9","observation_id":"bf54d0dc-c9f5-4b41-8114-f3b785d00f4f","resolution":{"observed_at":"2026-07-05T12:31:00.051741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.081000Z","title":null,"venue":null,"work_id":"da09875c-956f-496f-90ca-2872a77337e4","year":2023},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:4ee8e5a3119eae89b7750b49b5252333c2201cba24914f3236236410e2018d85","observation_id":"ef74b3e1-7dd6-4f0a-9639-d19b6552aabb","resolution":{"observed_at":"2026-07-05T12:31:00.082098Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-07-06T12:32:13.351732Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2201.12086","doi":"10.48550/arxiv.2201.12086","metadata_source":"pith","pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Blip: Bootstrapping language- image pre-training for uniﬁed vision-language understanding and generation","venue":"cs.CV","work_id":"ed5a5938-1f3b-44a9-9543-ebafa9af4d53","year":2022},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:df32fc092caabddf8ca7f8c7deec6e23e0173c20df753ec0f174a408e833a994","observation_id":"6d6ce162-132d-45d7-be0c-2a148a666db9","resolution":{"observed_at":"2026-07-05T12:30:59.881443Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01268","last_updated":"2024-06-20T14:21:37Z","snapshot_observed_at":"2026-07-06T18:24:21.774341Z","submitted_at":"2024-06-03T12:30:23Z","title":"Integral Probability Metrics on submanifolds: interpolation inequalities and optimal inference","version":2},"cited_work":{"arxiv_id":"2406.01268","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.01268","snapshot_observed_at":"2026-07-05T12:30:59.879490Z","title":"arXiv preprint arXiv:2406.01268 (2024)","venue":"math.ST","work_id":"6584f279-edb2-4ae9-874a-70f1564aff5c","year":2024},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"cited_paper":"/paper/2406.01268","citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:9da90c93dd02b1caf630518e90351e92d51b6012afd6a1a3e8927449abda051a","observation_id":"5495ec88-a050-4ba3-8af8-780d96ef3d3d","resolution":{"observed_at":"2026-07-05T12:30:59.880961Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.082771Z","title":"In: Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP) (2023)","venue":null,"work_id":"6a8be469-b785-49c9-8ef3-e51691a6ad9b","year":2023},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:4624d73d65e235316465443a48844b4df942e7d757f10fe4930f721199888a9a","observation_id":"4e0c5609-8ac1-4c18-b1b7-02a08f3666c5","resolution":{"observed_at":"2026-07-05T12:31:00.083982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:56:27.968575Z","title":null,"venue":null,"work_id":"e2616913-2672-4b77-be0e-a8dddf92de6f","year":2023},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:c004c3d73b343b8af1a2fe3777f4467e0f1241b4530591f900d58919618ba40c","observation_id":"3f063a40-dd45-4f66-87bc-f8abed9ab106","resolution":{"observed_at":"2026-07-05T12:31:00.085575Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":"2307.06281","doi":"10.48550/arxiv.2307.06281","metadata_source":"pith","pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","venue":"cs.CV","work_id":"3b44943d-0f15-4228-9ac3-0e376f4f9ada","year":2023},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:bf80484cb09a60199ca5c3122af3c76f2a0a7557a10591124478cad1422291df","observation_id":"4725a56c-d546-461a-b9b3-0ae4a5e9e249","resolution":{"observed_at":"2026-07-05T12:30:59.887960Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.075986Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision Workshops (2023)","venue":null,"work_id":"ea762117-383c-49e7-8dd5-2efaec117e1b","year":2023},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:c15834b6ad8a0386f39e49797b0d3685bb7e4f665e754c6aee0450b9bab3d203","observation_id":"b0cc5f1d-1b87-4380-8b07-ac3eb80d8798","resolution":{"observed_at":"2026-07-05T12:31:00.077211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.047049Z","title":"HuggingFace dataset (2024)","venue":null,"work_id":"4d4afb3f-bdfc-4e6c-9020-b8e9ecfadee4","year":2024},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:2eb74fb22a40c4a7811678e314b274e25c16e032b965746a3f06f5abf3e5c008","observation_id":"cff13f57-7794-4acb-b396-87c4048c0888","resolution":{"observed_at":"2026-07-05T12:31:00.048163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.081682Z","title":"HuggingFace dataset (2024)","venue":null,"work_id":"4b9721b5-2be2-4cdc-a52a-6a435e6c7fb4","year":2024},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:93f86bda0500020517bbe024a7cf56abe5de7c5318c96661b10442ad67de4994","observation_id":"728a7eb6-24d9-4b42-beba-61561da49cb6","resolution":{"observed_at":"2026-07-05T12:31:00.083048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.086984Z","title":"In: Advances in Neural Information Processing Systems (NeurIPS) (2022)","venue":null,"work_id":"6c0266d8-debc-4430-bce5-0fcbd3ac1bda","year":2022},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:b89d31d310bf6f70d3034bf0cda4110647a15815d88d4b39725a611b0b9a25ef","observation_id":"b8ccff5b-9340-46ac-8d6b-edc1a36b9318","resolution":{"observed_at":"2026-07-05T12:31:00.088132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.085211Z","title":"In: ACL (2022)","venue":null,"work_id":"c9647ecc-a384-46c2-82d2-ec87a2613fb7","year":2022},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:40c5657b06ee9d9efec774ba5563656683db1f56c8dd979d563231e1f717cd8a","observation_id":"b41e94bc-ea87-4713-a697-031e4d4d26a5","resolution":{"observed_at":"2026-07-05T12:31:00.086391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.062545Z","title":"In: WACV (2021)","venue":null,"work_id":"f323ea1e-dac3-4bfb-9635-497c2ca2915c","year":2021},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:687e727df7ff8135979911407e95eedf341c8078eb99c76414ceeeceda10e3f1","observation_id":"281fcdb0-1b71-4006-a352-aa86eb4a1f98","resolution":{"observed_at":"2026-07-05T12:31:00.063710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.047233Z","title":"HuggingFace dataset (2024)","venue":null,"work_id":"5cb41c12-3ada-4806-88b5-97c4ce5cc2a4","year":2024},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:3811405df353a2a4a2d2420d79262eb61cc49fb4a804fef7ce19cbc36e7d908b","observation_id":"54f12ae7-319d-4c9e-99a3-5ba74c0d8715","resolution":{"observed_at":"2026-07-05T12:31:00.048374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.060687Z","title":"Patterns (2021)","venue":null,"work_id":"759aefcd-cff6-4043-97af-207938de3a01","year":2021},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:62d372a9bd24718201862ea3956f98dd5de3ec59fd970c741948bf1fc55c72de","observation_id":"1c680fd4-5e7c-4f74-8b08-0514715c67ed","resolution":{"observed_at":"2026-07-05T12:31:00.061762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.035382Z","title":"HuggingFace model card (2024)","venue":null,"work_id":"c7ccd678-501a-4fa8-99e4-d7e48170ffb5","year":2024},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:82936e3116665c8c4fd88566b2cf0e724d2cc1154b629dc8bcc5cad4a34879c2","observation_id":"8eb6b9d8-eb7a-4af7-b9f1-7072956b1f6c","resolution":{"observed_at":"2026-07-05T12:31:00.036592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.071965Z","title":"In: International Conference on Machine Learning (2021)","venue":null,"work_id":"2935d61d-5113-46a9-b5a2-674da8cc4c9c","year":2021},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:fcdfdbe388e490403fb5d5e720f558038b7c4e4e7c02955f340635061508d709","observation_id":"118471df-10b7-457a-a494-9fbd9763093a","resolution":{"observed_at":"2026-07-05T12:31:00.073097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.070021Z","title":"In: CVPR (2019)","venue":null,"work_id":"4e2d2df4-71aa-4cbd-b0ba-25be70225ee0","year":2019},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:c8927fd926ecea4e454de052b92f7a5bfbe1eb5f82bef380e64c621469fffd91","observation_id":"13c96463-94c8-4a02-951e-b88da872e456","resolution":{"observed_at":"2026-07-05T12:31:00.071408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-07-06T18:16:42.428308Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":"2405.11985","doi":"10.48550/arxiv.2405.11985","metadata_source":"pith","pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":"cs.CV","work_id":"16708089-820b-4898-a73a-a876186f93ed","year":2024},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:360fd6f4968090ca44b4e9bbce4a19667d30ea483abd7107775130814cf941e7","observation_id":"d132e84b-6c28-4475-8e41-eb619ea4a887","resolution":{"observed_at":"2026-07-05T12:30:59.869841Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:cc98d0b0deb33572e98579b7ab260a6738a492565dd3f7075fca5ee3c24004c6","observation_id":"3565b1f1-91bc-4984-b369-9bca879a2396","resolution":{"observed_at":"2026-07-05T12:30:59.877464Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:31:00.066117Z","title":"HuggingFace dataset (2023)","venue":null,"work_id":"1a3b1e03-c0ba-4d06-a17f-54c3b4ac2022","year":2023},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:ee592a30ba6901625ad890026598d42cb0d5ddedee6fd3225d7e8290193a0bbf","observation_id":"e6418c5a-40eb-46f5-b371-bdc14dbf260d","resolution":{"observed_at":"2026-07-05T12:31:00.067719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14846","last_updated":"2025-05-21T14:42:25Z","snapshot_observed_at":"2026-07-06T20:40:01.776087Z","submitted_at":"2025-02-20T18:55:30Z","title":"Scaling Text-Rich Image Understanding via Code-Guided Synthetic Multimodal Data Generation","version":2},"cited_work":{"arxiv_id":"2502.14846","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.14846","snapshot_observed_at":"2026-07-05T12:30:59.857969Z","title":"Scaling text-rich image understanding via code-guided synthetic multimodal data generation","venue":"cs.CV","work_id":"39be73e1-080b-43ce-8696-4f829727e48e","year":2025},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"cited_paper":"/paper/2502.14846","citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:821675fd438dd6bd8df15cfd2982462c0e9cc19214b2921a933d8a5ee76d1fe5","observation_id":"143edbfc-d1ba-4bfd-be0c-1568758d717c","resolution":{"observed_at":"2026-07-05T12:30:59.860761Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":"1904.09675","doi":"10.48550/arxiv.1904.09675","metadata_source":"pith","pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-07-11T03:37:46.330230Z","title":"BERTScore: Evaluating Text Generation with BERT","venue":"cs.CL","work_id":"9eaaaac1-0a96-4f5f-9b13-30c46e9e1346","year":2019},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:1a0f6d69d5055cfd6e28508a5068cf0a196387d199abdba484970a9395677daa","observation_id":"0584df97-beb1-494f-9d5b-60198d09e5d4","resolution":{"observed_at":"2026-07-05T12:30:59.889621Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-05-20T14:22:13.077884+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T14:22:13.077884+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12345","last_updated":"2024-03-19T01:28:01Z","snapshot_observed_at":"2026-07-06T17:46:42.199436Z","submitted_at":"2024-03-19T01:28:01Z","title":"Performance Portable Monte Carlo Particle Transport on Intel, NVIDIA, and AMD GPUs","version":1},"cited_work":{"arxiv_id":"2403.12345","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.12345","snapshot_observed_at":"2026-07-05T12:30:59.882536Z","title":"Analyzing learning rate sensitivity in lora-fine-tuned language models","venue":"cs.DC","work_id":"44a5c65c-735d-41e0-a21f-52c7e1a406ef","year":2024},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"cited_paper":"/paper/2403.12345","citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:3aff4790848843eaaa0592cc832f745482b23fd9c37ee1ad799c64b7962175d8","observation_id":"bd2d77e1-ac2c-4147-b434-d7a6b0bde66c","resolution":{"observed_at":"2026-07-05T12:30:59.884018Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":1,"metadata_mismatch":7,"parse_uncertain":0,"unresolved":2,"verified_exact":6,"verified_fuzzy":28},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"thesis":"As of 31 July 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2604.18347."}