{"as_of":"2026-08-09T05:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:11222c3ceeee3bef7e4b21b996e17d48f7706e5206a70f05c6ee20114b3cc638","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T14:58:48.251828Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.06600/citation-record","integrity":"/paper/2502.06600/integrity","json":"/paper/2502.06600/citation-record.json","paper":"/paper/2502.06600"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1511.03292","last_updated":"2015-11-10T21:14:51Z","snapshot_observed_at":"2026-08-08T15:03:08.486608Z","submitted_at":"2015-11-10T21:14:51Z","title":"From Images to Sentences through Scene Description Graphs using Commonsense Reasoning and Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.03292","snapshot_observed_at":"2026-08-08T14:58:48.107848Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.107848Z"},"links":{"cited_paper":"/paper/1511.03292","citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:23e89627770c63ac95928af8c5046a32c29a7f5f2cba182cf415e8d0a9759ff9","observation_id":"83f9ae22-6664-4e3e-9ae7-facd58bf7ce4","resolution":{"observed_at":"2026-08-08T14:58:48.107848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.700384Z","title":null,"venue":null,"work_id":"aea4776c-437e-4813-8ed9-193a3381835f","year":2024},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.112701Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:9a4570a89f6411563107bb84eb0b8fb690992c76f91a9f5177d17e95f01c3c46","observation_id":"8d4fc923-288d-469e-8913-2e82bf926c33","resolution":{"observed_at":"2026-08-08T14:58:48.703743Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17733","last_updated":"2024-02-27T18:09:36Z","snapshot_observed_at":"2026-07-06T17:36:23.851926Z","submitted_at":"2024-02-27T18:09:36Z","title":"Tower: An Open Multilingual Large Language Model for Translation-Related Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17733","snapshot_observed_at":"2026-08-08T14:58:48.116638Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.116638Z"},"links":{"cited_paper":"/paper/2402.17733","citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:0b77c6e09e4bf936a6711835094b58842c1385ef74d0dc503320d9b5e4ba2553","observation_id":"6b138ef1-d3f6-4927-8fbb-ec2a0c8e06e4","resolution":{"observed_at":"2026-08-08T14:58:48.116638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.690063Z","title":null,"venue":null,"work_id":"a4524c3c-9e62-44af-b691-ae53adf9bc80","year":2022},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.120954Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:8bad91291e464b41944ab187f3ba0f0d088f2a641f359231aefbdd657681e33f","observation_id":"4e69acfb-352d-46d3-80bc-8845f2411477","resolution":{"observed_at":"2026-08-08T14:58:48.693345Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.680442Z","title":null,"venue":null,"work_id":"9920f67a-6d2c-4626-8092-fc14d94eb3ed","year":2023},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.124736Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:70a6925568bc84384bbee7bb4790461af181a456ff34dbf4c96a7c9c931f3683","observation_id":"ab46c83d-b001-4dd1-8c64-eeadb081bf10","resolution":{"observed_at":"2026-08-08T14:58:48.683627Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03567","last_updated":"2025-01-08T11:20:00Z","snapshot_observed_at":"2026-08-03T18:39:18.742312Z","submitted_at":"2025-01-07T06:35:34Z","title":"Evaluating Image Caption via Cycle-consistent Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2501.03567","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.03567","snapshot_observed_at":"2026-08-08T14:58:48.348233Z","title":"Evaluating Image Caption via Cycle-consistent Text-to-Image Generation","venue":"cs.CV","work_id":"c2c0f4b1-28b5-4c6c-ad8e-e6c2a1ea19cb","year":2025},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.128379Z"},"links":{"cited_paper":"/paper/2501.03567","citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:86255bd8d2564ae8a1b5df50e9ece511e52485063927c93dd559c7b281ada3bd","observation_id":"58f9782a-809f-4fa1-933c-d12dff79cff4","resolution":{"observed_at":"2026-08-08T14:58:48.351746Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.670750Z","title":null,"venue":null,"work_id":"cfd88667-1cb4-40b2-8855-84471180224d","year":2021},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.132436Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:46de42c646977a11fa21a64b0d6e1d6be118ab4b5e943d45d6b696ef660b7d18","observation_id":"1c9b6edf-f166-431e-9e0e-68708a488229","resolution":{"observed_at":"2026-08-08T14:58:48.673976Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06930","last_updated":"2024-06-20T06:48:17Z","snapshot_observed_at":"2026-08-01T21:48:29.941951Z","submitted_at":"2023-07-13T17:51:58Z","title":"mBLIP: Efficient Bootstrapping of Multilingual Vision-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06930","snapshot_observed_at":"2026-08-08T14:58:48.135855Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.135855Z"},"links":{"cited_paper":"/paper/2307.06930","citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:219ad0b04707464a7a62906c4c4efbbe7694c5b0efdf35996d63eb84b6ce69fc","observation_id":"7d6d3166-20b1-43c9-ad06-3b9f14f4478f","resolution":{"observed_at":"2026-08-08T14:58:48.135855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.660572Z","title":null,"venue":null,"work_id":"c3fa3efe-4f7f-4624-9207-d408209913c6","year":2021},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.139766Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:de55761095b593895e7de149931d9cfb4196ec12964f6ccd71f8e2422fce4fbd","observation_id":"054bdc68-448b-4a6b-900d-c853408c8bd1","resolution":{"observed_at":"2026-08-08T14:58:48.664055Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.650529Z","title":null,"venue":null,"work_id":"3eb24349-2c05-49f9-820c-47edfd68c4d7","year":2013},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.143162Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:e55cf9d0d48caf66ba5aac0e74e082ed5283407b36ab02f4e7933e238999c1fa","observation_id":"dcd3ac4a-2f04-42d5-86ba-ed55c2335154","resolution":{"observed_at":"2026-08-08T14:58:48.653900Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.639523Z","title":null,"venue":null,"work_id":"a8167ffd-6ed3-4654-a45f-6e6a6d33ee29","year":2023},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.146463Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:368625bf321540192b21a99391b53a8d79af14b09be7a5dd37e58863263a9a53","observation_id":"e8b7e6cb-d43e-4f60-bd21-d1e3534c6313","resolution":{"observed_at":"2026-08-08T14:58:48.643350Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.628845Z","title":null,"venue":null,"work_id":"b678af8d-5e22-414d-9369-be93238b7538","year":2021},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.149925Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:60d72ed92be150652c06c8943ea038739741903c1d8f56f0b84029f00486adc0","observation_id":"f4cd076b-50e7-4c45-88e4-127b8d59cb26","resolution":{"observed_at":"2026-08-08T14:58:48.632497Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.618641Z","title":null,"venue":null,"work_id":"67482fc8-ccd4-4d4d-b6ff-3d3f650dba70","year":2022},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.152564Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:14e9673686f90f183168b9ba9b42171a5ea9d3eb867dbb9dd4865f66ecc91124","observation_id":"f86b738c-e88b-462f-84b7-616c8fbf42da","resolution":{"observed_at":"2026-08-08T14:58:48.622305Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.607870Z","title":null,"venue":null,"work_id":"8caf5d9d-696f-4e5c-a1ef-5fe4b1e2aeec","year":2023},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.155242Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:2ab69cb608c88bf4e430fa86f77b38db1664d8f6b89fe15acf10e9f0d0d964cb","observation_id":"0509c59d-0ce0-4f90-b056-583aad488a4d","resolution":{"observed_at":"2026-08-08T14:58:48.611322Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06004","last_updated":"2024-06-10T03:57:39Z","snapshot_observed_at":"2026-08-04T20:09:33.779406Z","submitted_at":"2024-06-10T03:57:39Z","title":"FLEUR: An Explainable Reference-Free Evaluation Metric for Image Captioning Using a Large Multimodal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06004","snapshot_observed_at":"2026-08-08T14:58:48.157795Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.157795Z"},"links":{"cited_paper":"/paper/2406.06004","citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:40282f9c236bfdaa9f42be01ecd84053f95a58f044b2746afca8e33398a4d79c","observation_id":"262e7b40-e123-4ea2-a546-18028f092554","resolution":{"observed_at":"2026-08-08T14:58:48.157795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.596898Z","title":null,"venue":null,"work_id":"b7bbd0cb-3462-495e-affa-7eb830ca2c93","year":2021},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.160659Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:13960d80731d5c3879bacc585f1bbb7986b8ab4e3aa1e8738bbf6a34f07726e8","observation_id":"e94ee4ea-f377-4b0f-8732-a7ba9c3bb5ab","resolution":{"observed_at":"2026-08-08T14:58:48.600724Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.585911Z","title":null,"venue":null,"work_id":"c8214032-1bae-4e7b-b4b9-4cef7b002396","year":2020},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.163384Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:1b8b7cdbe7bbb09b9d6b814f3060d37a8f1601ce5c4f0bc2689bcf3724af07d8","observation_id":"5dd98dfd-ec45-4b48-b16e-190a8b5ee264","resolution":{"observed_at":"2026-08-08T14:58:48.589632Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.574834Z","title":null,"venue":null,"work_id":"923882a6-a609-47db-bda9-0fe6ae63a815","year":2020},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.166210Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:155341170c592873c8113cf305bafee52175a53dacb462cd8d563cd6b17e2475","observation_id":"2a499ef0-c798-4326-958d-05772ebe347c","resolution":{"observed_at":"2026-08-08T14:58:48.578526Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.563743Z","title":null,"venue":null,"work_id":"e14cec7a-78d2-4fb1-ad68-3639ce3fa642","year":2024},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.168871Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:11e38b5597828267371047585d3f399abc19b5c08b054f324b0628c4cee11b17","observation_id":"dcabe155-8dab-4e76-91c0-868983d29dd0","resolution":{"observed_at":"2026-08-08T14:58:48.567322Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.552958Z","title":null,"venue":null,"work_id":"2aca137d-817a-4b08-97fc-36e89877f40b","year":2022},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.171937Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:b956f7052c2fcdd9809cc97bec605229929695b9fdfac04966067b742dabc5ba","observation_id":"52e30fe1-49a0-4c7a-a590-48eef4db58df","resolution":{"observed_at":"2026-08-08T14:58:48.556817Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.542855Z","title":null,"venue":null,"work_id":"aaf30c1c-afb9-4516-b3da-c5f23a501edc","year":2023},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.175223Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:be365d8ed5ed3cf57364d1b62706eb3acf7e73c4ceea968cf335bc4f2b84deba","observation_id":"e827993b-975c-49bd-b84a-0efffdec7d0e","resolution":{"observed_at":"2026-08-08T14:58:48.545931Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.178520Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.178520Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:33ba3628270e68652a7566fb42dce52081c365b7eb902c0894614e5f2055c324","observation_id":"cd7d2f62-94a8-4d85-a4a6-1f32bfd8f481","resolution":{"observed_at":"2026-08-08T14:58:48.178520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.526230Z","title":null,"venue":null,"work_id":"8ecc94b4-ab4a-417a-a134-457dab7c36f2","year":2024},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.181934Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:c0ad57c581b59769d2fbe50229d0e7c1d520359a743df373f4eaa9d9d902f7d4","observation_id":"720e87c9-ba5b-4ca1-9252-aee9ddfa6290","resolution":{"observed_at":"2026-08-08T14:58:48.529185Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.517356Z","title":null,"venue":null,"work_id":"7c07db66-161a-45e2-a8c0-84fe15ca73f7","year":2023},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.185359Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:cfe8f10ab12edc5bb0ee6581de5b2cb65451959ac2a71f580e5164226dc21d95","observation_id":"2c560504-c6a2-4af7-a220-b923ba8bf3ad","resolution":{"observed_at":"2026-08-08T14:58:48.520419Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.508576Z","title":null,"venue":null,"work_id":"9b51c95e-545c-473f-9fdb-56a01112585d","year":2023},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.188730Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:08104e72126a643b79679ac9e9f377f3159a13f0c44895caa05f648b2a391965","observation_id":"91ae5dad-3086-4095-902b-c279a8d85fa4","resolution":{"observed_at":"2026-08-08T14:58:48.511567Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.498695Z","title":null,"venue":null,"work_id":"b1552586-27e8-42ba-abc4-e409adeabd5a","year":2023},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.192388Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:719f447878d1c03759725ef0ab236073f78c8c3b1ce89d5d070c8af37898cef9","observation_id":"93864a7b-81d6-4f6b-9c5d-fe781abf2d33","resolution":{"observed_at":"2026-08-08T14:58:48.502102Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.488987Z","title":null,"venue":null,"work_id":"bf4a00a1-c4a4-4ec4-a7a0-9ae82404cc7a","year":2023},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.195667Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:8ea279db8e98a499ece5d68ff7e9c579188cd146bd133bf42c2cf377b2d4cdeb","observation_id":"3ff3180b-db37-4e66-a805-e6ba78042af0","resolution":{"observed_at":"2026-08-08T14:58:48.492448Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.478819Z","title":null,"venue":null,"work_id":"6e87430a-c890-4227-bdf0-895f628c32fd","year":2022},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.199242Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:869e14866cf38ce9226f1dd426dfd73ef24904a50b58dc399de92ba6806c0fc6","observation_id":"0128b44b-877f-49ea-b537-4d2c28710619","resolution":{"observed_at":"2026-08-08T14:58:48.482354Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.468922Z","title":null,"venue":null,"work_id":"6fb91b82-9ca2-40d1-b37b-0817f26022d3","year":2023},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.202653Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:4493857dc5ab4a1e1e434d2c1f8f2f801b056afca85ce25fdaeb857bfc776c2f","observation_id":"f4db2265-c362-4c07-bb56-8c486bd1e2b1","resolution":{"observed_at":"2026-08-08T14:58:48.472530Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.459044Z","title":null,"venue":null,"work_id":"d8b07b66-e0e8-460b-a2a7-283a79607422","year":2024},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.206031Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:091844be1713ba3bb128a77e2f38682d167bbda2702d8f25da159041c9a5f8c3","observation_id":"88661f33-1a84-4df6-8210-b8a6f49236f4","resolution":{"observed_at":"2026-08-08T14:58:48.462397Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07336","last_updated":"2025-07-29T19:14:56Z","snapshot_observed_at":"2026-08-06T00:59:46.952830Z","submitted_at":"2024-10-09T18:00:09Z","title":"Positive-Augmented Contrastive Learning for Vision-and-Language Evaluation and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07336","snapshot_observed_at":"2026-08-08T14:58:48.209337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.209337Z"},"links":{"cited_paper":"/paper/2410.07336","citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:68f0c7c4d0893c92077328d110f3a0c96fe2b11599f540026003c88d100ccbd5","observation_id":"70bab504-fbe1-4dcd-94b0-de0d35278fbd","resolution":{"observed_at":"2026-08-08T14:58:48.209337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.448928Z","title":null,"venue":null,"work_id":"69f63f40-740b-47cb-b4d3-0b50bb6e1185","year":2022},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.213093Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:6eba660cc95f1c9c61ad6ec47838ea52818e1e1bb77a576ed696797bfc23efad","observation_id":"30ead303-1f8d-4752-8115-bc8cd0becdc4","resolution":{"observed_at":"2026-08-08T14:58:48.452291Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.438798Z","title":null,"venue":null,"work_id":"ced7163d-d522-4412-b772-36ffb3846f90","year":2019},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.216626Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:d148562aa73e20ae712144dbf5c5e418c895208d6479167f4a5845b6e5997f3b","observation_id":"a4d74aca-a523-4c46-b549-d18939fdc182","resolution":{"observed_at":"2026-08-08T14:58:48.442298Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.428657Z","title":null,"venue":null,"work_id":"dc852ba3-d831-4971-a4dc-93f65fc3572b","year":2022},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.219896Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:446585131e6f2761a6ac2291a34210bd1b81b5037415710e7f4bcb8d90c34643","observation_id":"91a1aeb2-7791-4bb0-806e-49a13e7c416f","resolution":{"observed_at":"2026-08-08T14:58:48.431991Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13647","last_updated":"2024-12-19T15:37:55Z","snapshot_observed_at":"2026-08-05T12:04:38.510941Z","submitted_at":"2024-12-18T09:23:12Z","title":"G-VEval: A Versatile Metric for Evaluating Image and Video Captions Using GPT-4o","version":2},"cited_work":{"arxiv_id":"2412.13647","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.13647","snapshot_observed_at":"2026-08-08T14:58:48.302502Z","title":"G-VEval: A Versatile Metric for Evaluating Image and Video Captions Using GPT-4o","venue":"cs.CV","work_id":"47a7ba01-e19e-454d-bdc0-e5eb87190ba2","year":2024},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.223313Z"},"links":{"cited_paper":"/paper/2412.13647","citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:21c2a67d04c64fd4fccabef46c4f65d2bae6d18a76bf2135e55cf8560c881c19","observation_id":"5444d6e4-1a51-4718-8f98-e699647f718d","resolution":{"observed_at":"2026-08-08T14:58:48.309144Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.418157Z","title":null,"venue":null,"work_id":"8a0cc460-b83f-4012-815d-6dfdfb506dc2","year":2015},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.227281Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:d04e793b39ea6feb298019f83d839e161076459357513b3ea5978d696c345c9f","observation_id":"80b7e105-15a2-437c-83b2-7746e24bfdb2","resolution":{"observed_at":"2026-08-08T14:58:48.421535Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.407892Z","title":null,"venue":null,"work_id":"663d5b84-55c2-4307-994b-9e9923afdc4f","year":2024},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.230725Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:d7c8df74ccfa786111202c22c97bff7a2aea6babc81cadb2af8db6ad8cd93c15","observation_id":"8e4b798c-3d69-4815-acbf-c5c5db183cf4","resolution":{"observed_at":"2026-08-08T14:58:48.411384Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.398510Z","title":null,"venue":null,"work_id":"b2922c59-b6f7-498a-b078-a981d2534989","year":2023},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.234045Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:0c25e20a7952369b45daa258f0c32687b22eb52c1974a5f95995488201de7e03","observation_id":"9fede902-8fa7-4281-a23a-e75100d5d95e","resolution":{"observed_at":"2026-08-08T14:58:48.401688Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.06706","last_updated":"2019-01-20T17:55:05Z","snapshot_observed_at":"2026-08-08T23:17:13.003005Z","submitted_at":"2019-01-20T17:55:05Z","title":"Visual Entailment: A Novel Task for Fine-Grained Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.06706","snapshot_observed_at":"2026-08-08T14:58:48.237478Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.237478Z"},"links":{"cited_paper":"/paper/1901.06706","citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:69995adcb8f5c3d3794d5550c2b15aa3d5da7d1d0d99705a819abc7e7e146c5c","observation_id":"e0a843d9-4994-4c1b-8a96-0b8dd8c8be83","resolution":{"observed_at":"2026-08-08T14:58:48.237478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.12043","last_updated":"2024-04-13T17:02:25Z","snapshot_observed_at":"2026-08-06T09:54:52.355397Z","submitted_at":"2022-12-22T21:27:12Z","title":"When are Lemons Purple? The Concept Association Bias of Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.12043","snapshot_observed_at":"2026-08-08T14:58:48.240959Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.240959Z"},"links":{"cited_paper":"/paper/2212.12043","citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:3aaedce081c34b01bb595fefd3ffcf862bc5c302f781977d4e7cf1b1ca6076e4","observation_id":"3e996417-493e-4955-a628-82ecb0dba27f","resolution":{"observed_at":"2026-08-08T14:58:48.240959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.389382Z","title":null,"venue":null,"work_id":"a04947b9-5d44-4ced-a930-309fdf9f088c","year":2023},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.244606Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:1f77c46b57ebd2aadf9e14df775c3c1d04c4ac541db67f10cae03b46e20b2aa1","observation_id":"55d6fdf1-22a0-49e7-b462-f7684214929e","resolution":{"observed_at":"2026-08-08T14:58:48.392417Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.248032Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.248032Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:ab66f12f86351c62a7e0aaf8cc164c3be920ac101c1a2e37c7394c5515c521b3","observation_id":"d455749d-bc74-4cf7-b9b3-4288580f2fab","resolution":{"observed_at":"2026-08-08T14:58:48.248032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T14:58:48.251828Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T14:58:48.251828Z"},"links":{"citing_paper":"/paper/2502.06600"},"observation_digest":"sha256:4822dfc2b96b519d2b3c11f8e5d3ea0a4f92866430a5b40177707e2442a07059","observation_id":"ecbced9a-afae-4de3-ac64-1f0c38fbdb2e","resolution":{"observed_at":"2026-08-08T14:58:48.251828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06600","last_updated":"2025-02-17T15:22:32Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T20:57:31.742264Z","submitted_at":"2025-02-10T16:00:00Z","title":"Evaluation of Multilingual Image Captioning: How far can we get with CLIP models?"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2502.06600."}