{"as_of":"2026-08-17T21:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6f6296a62f4141470ffe38d3ae7484642bcf7a3cf4693089334cdf02a574093d","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:16:40.690722Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.13628/citation-record","integrity":"/paper/2505.13628/integrity","json":"/paper/2505.13628/citation-record.json","paper":"/paper/2505.13628"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/p19-1395","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:40.807283Z","title":null,"venue":null,"work_id":"c8c1c0d0-d8a6-49d4-b50b-220f8e754269","year":2019},"citing_paper":{"arxiv_id":"2505.13628","last_updated":"2025-05-19T18:06:45Z","snapshot_observed_at":"2026-08-17T16:36:37.659546Z","submitted_at":"2025-05-19T18:06:45Z","title":"Cross-Lingual Representation Alignment Through Contrastive Image-Caption Tuning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T20:16:40.606056Z"},"links":{"citing_paper":"/paper/2505.13628"},"observation_digest":"sha256:cbd320206258ac7e3b9a775e5a045dea6c4ebccf7249139f14954c58663d5ef1","observation_id":"c96812ad-3878-4cb6-bbe3-15f69538fd96","resolution":{"observed_at":"2026-08-15T20:16:40.811347Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:40.610324Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.13628","last_updated":"2025-05-19T18:06:45Z","snapshot_observed_at":"2026-08-17T16:36:37.659546Z","submitted_at":"2025-05-19T18:06:45Z","title":"Cross-Lingual Representation Alignment Through Contrastive Image-Caption Tuning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T20:16:40.610324Z"},"links":{"citing_paper":"/paper/2505.13628"},"observation_digest":"sha256:ad8107bc90c0dcc76290880cdfa59f18ccd4aa04921f8f051e6de3c3caec03a0","observation_id":"75831847-55ce-4e9f-8ff8-95e96e97075f","resolution":{"observed_at":"2026-08-15T20:16:40.610324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.08688","last_updated":"2021-08-19T13:53:47Z","snapshot_observed_at":"2026-08-16T18:02:15.731919Z","submitted_at":"2021-08-19T13:53:47Z","title":"Contrastive Language-Image Pre-training for the Italian Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.08688","snapshot_observed_at":"2026-08-15T20:16:40.614397Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13628","last_updated":"2025-05-19T18:06:45Z","snapshot_observed_at":"2026-08-17T16:36:37.659546Z","submitted_at":"2025-05-19T18:06:45Z","title":"Cross-Lingual Representation Alignment Through Contrastive Image-Caption Tuning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T20:16:40.614397Z"},"links":{"cited_paper":"/paper/2108.08688","citing_paper":"/paper/2505.13628"},"observation_digest":"sha256:905de99082494d6e2c5d944c3e48498a7294cd4ba873a7ccaa8528ab785843ff","observation_id":"354eedba-cdae-4e60-87eb-fe5baa7e857e","resolution":{"observed_at":"2026-08-15T20:16:40.614397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:40.618516Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13628","last_updated":"2025-05-19T18:06:45Z","snapshot_observed_at":"2026-08-17T16:36:37.659546Z","submitted_at":"2025-05-19T18:06:45Z","title":"Cross-Lingual Representation Alignment Through Contrastive Image-Caption Tuning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T20:16:40.618516Z"},"links":{"citing_paper":"/paper/2505.13628"},"observation_digest":"sha256:026b6f6694438a0ab67422518be34d7b9a62ba39dc1e78c252583c26b0e5f3a4","observation_id":"c1437062-d922-4158-b86c-3a81249fdd91","resolution":{"observed_at":"2026-08-15T20:16:40.618516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:40.623658Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13628","last_updated":"2025-05-19T18:06:45Z","snapshot_observed_at":"2026-08-17T16:36:37.659546Z","submitted_at":"2025-05-19T18:06:45Z","title":"Cross-Lingual Representation Alignment Through Contrastive Image-Caption Tuning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T20:16:40.623658Z"},"links":{"citing_paper":"/paper/2505.13628"},"observation_digest":"sha256:465bb36b22da12a8c858f0e7f490e9c0bb05f0b370c6140d1eb141137d70ef36","observation_id":"1ae40a26-c959-4b40-a4ef-6d2886987259","resolution":{"observed_at":"2026-08-15T20:16:40.623658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:40.628099Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.13628","last_updated":"2025-05-19T18:06:45Z","snapshot_observed_at":"2026-08-17T16:36:37.659546Z","submitted_at":"2025-05-19T18:06:45Z","title":"Cross-Lingual Representation Alignment Through Contrastive Image-Caption Tuning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T20:16:40.628099Z"},"links":{"citing_paper":"/paper/2505.13628"},"observation_digest":"sha256:c7cad882e289bf390b9c9e25a2b6cbaa22c60c0feb84ec6bd7a2499ce1623926","observation_id":"c4ff2435-0c91-4806-9ee0-89c4cdc84f89","resolution":{"observed_at":"2026-08-15T20:16:40.628099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02116","last_updated":"2020-04-08T01:02:17Z","snapshot_observed_at":"2026-08-16T12:39:33.749100Z","submitted_at":"2019-11-05T22:42:00Z","title":"Unsupervised Cross-lingual Representation Learning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02116","snapshot_observed_at":"2026-08-15T20:16:40.632055Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.13628","last_updated":"2025-05-19T18:06:45Z","snapshot_observed_at":"2026-08-17T16:36:37.659546Z","submitted_at":"2025-05-19T18:06:45Z","title":"Cross-Lingual Representation Alignment Through Contrastive Image-Caption Tuning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T20:16:40.632055Z"},"links":{"cited_paper":"/paper/1911.02116","citing_paper":"/paper/2505.13628"},"observation_digest":"sha256:dbdd2d4e229e3c198bbc67f8c8b6235ccc4566128df4879f00536453682d50aa","observation_id":"e53d9822-fd79-4ef2-847a-751e5cff4c00","resolution":{"observed_at":"2026-08-15T20:16:40.632055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:40.635664Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.13628","last_updated":"2025-05-19T18:06:45Z","snapshot_observed_at":"2026-08-17T16:36:37.659546Z","submitted_at":"2025-05-19T18:06:45Z","title":"Cross-Lingual Representation Alignment Through Contrastive Image-Caption Tuning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T20:16:40.635664Z"},"links":{"citing_paper":"/paper/2505.13628"},"observation_digest":"sha256:0cf48cf8525e9600a35c6562ac274b145d33cc2799449ef2f5876986b22da7cd","observation_id":"f0f8caee-99fa-454b-b457-58eab5f9678b","resolution":{"observed_at":"2026-08-15T20:16:40.635664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-15T20:16:40.638810Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13628","last_updated":"2025-05-19T18:06:45Z","snapshot_observed_at":"2026-08-17T16:36:37.659546Z","submitted_at":"2025-05-19T18:06:45Z","title":"Cross-Lingual Representation Alignment Through Contrastive Image-Caption Tuning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T20:16:40.638810Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.13628"},"observation_digest":"sha256:d4edb0c6335f9580f130e10f400aeab332a358aa9ee8dd3e3bcd76b5d78a9d61","observation_id":"35bc2c65-f20f-48b1-8fe6-e94fe1a8d119","resolution":{"observed_at":"2026-08-15T20:16:40.638810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11466","last_updated":"2023-08-23T10:46:16Z","snapshot_observed_at":"2026-08-16T23:24:33.736662Z","submitted_at":"2023-08-22T14:25:15Z","title":"SONAR: Sentence-Level Multimodal and Language-Agnostic Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11466","snapshot_observed_at":"2026-08-15T20:16:40.641890Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13628","last_updated":"2025-05-19T18:06:45Z","snapshot_observed_at":"2026-08-17T16:36:37.659546Z","submitted_at":"2025-05-19T18:06:45Z","title":"Cross-Lingual Representation Alignment Through Contrastive Image-Caption Tuning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T20:16:40.641890Z"},"links":{"cited_paper":"/paper/2308.11466","citing_paper":"/paper/2505.13628"},"observation_digest":"sha256:f594404a4b12ae787a9afa17bb5295145aefeb3a7052f884ebae2aa742fedff3","observation_id":"33608e34-5679-43f0-bbb3-34a134100ab2","resolution":{"observed_at":"2026-08-15T20:16:40.641890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:40.645702Z","title":"Costa-juss \\`a , Jos \\'e A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13628","last_updated":"2025-05-19T18:06:45Z","snapshot_observed_at":"2026-08-17T16:36:37.659546Z","submitted_at":"2025-05-19T18:06:45Z","title":"Cross-Lingual Representation Alignment Through Contrastive Image-Caption Tuning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T20:16:40.645702Z"},"links":{"citing_paper":"/paper/2505.13628"},"observation_digest":"sha256:fe0b707f90881df80afee879c2c5dce681b591404ac551bd02cf6ff7d912300e","observation_id":"f9d4d0e6-0d51-4eeb-9608-0ef316f5ba2a","resolution":{"observed_at":"2026-08-15T20:16:40.645702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:40.649312Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13628","last_updated":"2025-05-19T18:06:45Z","snapshot_observed_at":"2026-08-17T16:36:37.659546Z","submitted_at":"2025-05-19T18:06:45Z","title":"Cross-Lingual Representation Alignment Through Contrastive Image-Caption Tuning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T20:16:40.649312Z"},"links":{"citing_paper":"/paper/2505.13628"},"observation_digest":"sha256:917de80612e609b727f0b762ba669533194e95d1a4999a93dc3b6a912d543c3d","observation_id":"e7241ea8-ca7b-487d-82d1-3998d0b9137b","resolution":{"observed_at":"2026-08-15T20:16:40.649312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:40.653107Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13628","last_updated":"2025-05-19T18:06:45Z","snapshot_observed_at":"2026-08-17T16:36:37.659546Z","submitted_at":"2025-05-19T18:06:45Z","title":"Cross-Lingual Representation Alignment Through Contrastive Image-Caption Tuning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T20:16:40.653107Z"},"links":{"citing_paper":"/paper/2505.13628"},"observation_digest":"sha256:c1cac65c3719b4388981ec606f730e43c5356e76cfa75bdd4bc65ad0ed1aa7c8","observation_id":"dafdae33-b930-43fe-8bb0-48b197a81816","resolution":{"observed_at":"2026-08-15T20:16:40.653107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:40.657297Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13628","last_updated":"2025-05-19T18:06:45Z","snapshot_observed_at":"2026-08-17T16:36:37.659546Z","submitted_at":"2025-05-19T18:06:45Z","title":"Cross-Lingual Representation Alignment Through Contrastive Image-Caption Tuning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T20:16:40.657297Z"},"links":{"citing_paper":"/paper/2505.13628"},"observation_digest":"sha256:c7736bd0cc5386cedcdebadc630aac06dde78ae89a833fa917558b966176a1be","observation_id":"6ff06b46-7c92-4a28-880b-243a632a6c36","resolution":{"observed_at":"2026-08-15T20:16:40.657297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:40.660865Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.13628","last_updated":"2025-05-19T18:06:45Z","snapshot_observed_at":"2026-08-17T16:36:37.659546Z","submitted_at":"2025-05-19T18:06:45Z","title":"Cross-Lingual Representation Alignment Through Contrastive Image-Caption Tuning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T20:16:40.660865Z"},"links":{"citing_paper":"/paper/2505.13628"},"observation_digest":"sha256:66dd0915cbf7f12bc92fdd1d19a8d9ada0ef0a8d52ebe77a77d62ae22665e1b2","observation_id":"b0e23b28-030f-413c-87d1-8f6a418173c4","resolution":{"observed_at":"2026-08-15T20:16:40.660865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1405.0312","last_updated":"2015-02-21T01:48:49Z","snapshot_observed_at":"2026-07-06T03:42:37.507458Z","submitted_at":"2014-05-01T21:43:32Z","title":"Microsoft COCO: Common Objects in Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1405.0312","snapshot_observed_at":"2026-08-15T20:16:40.664701Z","title":"Lawrence Zitnick, and Piotr Dollár","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.13628","last_updated":"2025-05-19T18:06:45Z","snapshot_observed_at":"2026-08-17T16:36:37.659546Z","submitted_at":"2025-05-19T18:06:45Z","title":"Cross-Lingual Representation Alignment Through Contrastive Image-Caption Tuning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T20:16:40.664701Z"},"links":{"cited_paper":"/paper/1405.0312","citing_paper":"/paper/2505.13628"},"observation_digest":"sha256:5b842bd43f5ffc0daae14bdd5fdb63cfecfb3b93fa00e4feb99b3771e91bbfc5","observation_id":"017d27d9-98a9-4fbc-91b7-512ddae8b3b8","resolution":{"observed_at":"2026-08-15T20:16:40.664701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.11954","last_updated":"2020-04-28T19:51:43Z","snapshot_observed_at":"2026-08-06T15:41:57.240403Z","submitted_at":"2020-04-24T19:30:38Z","title":"Practical Comparable Data Collection for Low-Resource Languages via Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.11954","snapshot_observed_at":"2026-08-15T20:16:40.668581Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.13628","last_updated":"2025-05-19T18:06:45Z","snapshot_observed_at":"2026-08-17T16:36:37.659546Z","submitted_at":"2025-05-19T18:06:45Z","title":"Cross-Lingual Representation Alignment Through Contrastive Image-Caption Tuning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T20:16:40.668581Z"},"links":{"cited_paper":"/paper/2004.11954","citing_paper":"/paper/2505.13628"},"observation_digest":"sha256:17ea4e020936898e53ddc104e8f17ffd9ef7812990a787273511c700aa0f1341","observation_id":"6b026da7-e32a-4abb-9015-dac1ebf6a7f9","resolution":{"observed_at":"2026-08-15T20:16:40.668581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:40.672445Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13628","last_updated":"2025-05-19T18:06:45Z","snapshot_observed_at":"2026-08-17T16:36:37.659546Z","submitted_at":"2025-05-19T18:06:45Z","title":"Cross-Lingual Representation Alignment Through Contrastive Image-Caption Tuning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T20:16:40.672445Z"},"links":{"citing_paper":"/paper/2505.13628"},"observation_digest":"sha256:88a7ea925f0fee9e9aa6d1d0940dbc34fdff92f615ec6285f26d6b5628367c2f","observation_id":"1e9f7732-aed0-4e02-a860-2ca1411084dc","resolution":{"observed_at":"2026-08-15T20:16:40.672445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:40.676352Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.13628","last_updated":"2025-05-19T18:06:45Z","snapshot_observed_at":"2026-08-17T16:36:37.659546Z","submitted_at":"2025-05-19T18:06:45Z","title":"Cross-Lingual Representation Alignment Through Contrastive Image-Caption Tuning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T20:16:40.676352Z"},"links":{"citing_paper":"/paper/2505.13628"},"observation_digest":"sha256:97ec9564f0604cf9ed92b896967b814a7e234fa0796ef48959b46cc209e4b27c","observation_id":"5dc5c409-f01a-4a0d-80e5-50d50eab3fb9","resolution":{"observed_at":"2026-08-15T20:16:40.676352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-08-14T05:02:11.716316Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-15T20:16:40.679796Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.13628","last_updated":"2025-05-19T18:06:45Z","snapshot_observed_at":"2026-08-17T16:36:37.659546Z","submitted_at":"2025-05-19T18:06:45Z","title":"Cross-Lingual Representation Alignment Through Contrastive Image-Caption Tuning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T20:16:40.679796Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2505.13628"},"observation_digest":"sha256:9f792e7a354b5cc59d0a076f83a46da84fe73ee3a2ebb31ce88c90df753f5393","observation_id":"fe9de46f-e03a-4b64-a1a8-3b8a63e42c0c","resolution":{"observed_at":"2026-08-15T20:16:40.679796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04672","last_updated":"2022-08-25T17:10:53Z","snapshot_observed_at":"2026-07-06T13:29:47.927628Z","submitted_at":"2022-07-11T07:33:36Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.04672","snapshot_observed_at":"2026-08-15T20:16:40.684284Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13628","last_updated":"2025-05-19T18:06:45Z","snapshot_observed_at":"2026-08-17T16:36:37.659546Z","submitted_at":"2025-05-19T18:06:45Z","title":"Cross-Lingual Representation Alignment Through Contrastive Image-Caption Tuning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T20:16:40.684284Z"},"links":{"cited_paper":"/paper/2207.04672","citing_paper":"/paper/2505.13628"},"observation_digest":"sha256:90a843522ea44ac0e0054541254841416c3290e8d1f86980eb1c186b16cf445a","observation_id":"d6b8430a-cf63-4a14-a6ff-5092a03e5813","resolution":{"observed_at":"2026-08-15T20:16:40.684284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.acl-long.595","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:40.725276Z","title":null,"venue":null,"work_id":"1b79edc0-6d1d-4faf-af81-031ab6e9dcd0","year":2022},"citing_paper":{"arxiv_id":"2505.13628","last_updated":"2025-05-19T18:06:45Z","snapshot_observed_at":"2026-08-17T16:36:37.659546Z","submitted_at":"2025-05-19T18:06:45Z","title":"Cross-Lingual Representation Alignment Through Contrastive Image-Caption Tuning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T20:16:40.687816Z"},"links":{"citing_paper":"/paper/2505.13628"},"observation_digest":"sha256:b38e9607ad2dad822fd87bf93c9092f4e0cb8096099713be28e2d09215a2a6e0","observation_id":"e9beb91a-e811-4199-9705-0f5ca1d314a8","resolution":{"observed_at":"2026-08-15T20:16:40.729705Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:16:40.690722Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.13628","last_updated":"2025-05-19T18:06:45Z","snapshot_observed_at":"2026-08-17T16:36:37.659546Z","submitted_at":"2025-05-19T18:06:45Z","title":"Cross-Lingual Representation Alignment Through Contrastive Image-Caption Tuning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T20:16:40.690722Z"},"links":{"citing_paper":"/paper/2505.13628"},"observation_digest":"sha256:00ba8f33ba3579e46a655d7239a1629cfe868a77ccce23433bf947a99c1e6971","observation_id":"bba8de0b-fcf1-4ae2-a9be-12378e1677b0","resolution":{"observed_at":"2026-08-15T20:16:40.690722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.13628","last_updated":"2025-05-19T18:06:45Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T16:36:37.659546Z","submitted_at":"2025-05-19T18:06:45Z","title":"Cross-Lingual Representation Alignment Through Contrastive Image-Caption Tuning"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2505.13628."}