{"as_of":"2026-08-16T04:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5f1f78e52cdd2d6381dbe67b2a1c619b06a5e38b3a07421a7b0cfa6cf56db43a","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:51:16.765188Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.20411/citation-record","integrity":"/paper/2507.20411/integrity","json":"/paper/2507.20411/citation-record.json","paper":"/paper/2507.20411"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:17.349935Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":null,"work_id":"e1a9d935-8769-4db7-af1d-b0012971c6e7","year":2022},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.576514Z"},"links":{"citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:fa35ee2252dbdb2649e1b84e042a855af90973db61b30e78fbddaa6e6207e389","observation_id":"85bc558f-938b-4dd0-b042-62e02b334afc","resolution":{"observed_at":"2026-08-15T17:51:17.353819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:17.338161Z","title":"mCLIP : Multilingual clip via cross-lingual transfer","venue":null,"work_id":"9d79d887-6273-400d-9680-028fe7d71d17","year":2023},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.581430Z"},"links":{"citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:5ad4b8d64f3b578131b0c2d30b0a81b0f8004a7dcd7021ef64b33653ca5c28d9","observation_id":"47ea6d02-c789-4414-a71a-eb1e62ded684","resolution":{"observed_at":"2026-08-15T17:51:17.342951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-16T01:18:27.067382Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-15T17:51:16.585591Z","title":"Microsoft COCO captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.585591Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:4b20afb7bed6ff7dbc5fa14415d5c965aeb40c93ec0b9c0d73fb574b39d99254","observation_id":"6a0dbf99-f686-4062-af51-915912b086e7","resolution":{"observed_at":"2026-08-15T17:51:16.585591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:17.326550Z","title":"Vicuna: An open-source chatbot impressing GPT-4 with 90\\ See https://vicuna","venue":null,"work_id":"69ce7bf9-ca29-4db4-ae9a-a5300b0ac03d","year":2023},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.590190Z"},"links":{"citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:57263711fc6c7d1224b635aca0057c04cee5ec6552005c379af1571856c73768","observation_id":"c314bc97-07df-4dc5-a2ff-61a0536bd5a7","resolution":{"observed_at":"2026-08-15T17:51:17.330972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:17.316018Z","title":"The Faiss library","venue":null,"work_id":"fdb557a8-9bf6-40b5-90e5-bbe495a86adf","year":2024},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.594311Z"},"links":{"citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:fef8617ce0fc46d99a4166ac4191d5869bf8f382266faadd15d8797c4d7b6789","observation_id":"ecfe5081-d108-4786-af45-3b16dd096d42","resolution":{"observed_at":"2026-08-15T17:51:17.319457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:17.305475Z","title":"A survey on rag meeting llms: Towards retrieval-augmented large language models","venue":null,"work_id":"b5d8421e-34a6-41fe-88a1-f7882ece2173","year":2024},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.598553Z"},"links":{"citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:65e8fa0887a0ff1e4e38d6ba957a347484e75d432919a97f0cfbccca2fbf49d2","observation_id":"846e8690-b5db-4738-954d-6530ab540ff4","resolution":{"observed_at":"2026-08-15T17:51:17.309117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:16.607728Z","title":"m BLIP : Efficient bootstrapping of multilingual vision- LLM s","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.607728Z"},"links":{"citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:8a7a8dd42ad6c08e399bb4e47ddcdb1e0336cb221b9a3f4e63de02b1388f4d91","observation_id":"17276bd8-4f06-4674-b3f3-105646f266da","resolution":{"observed_at":"2026-08-15T17:51:16.607728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-15T17:51:16.612200Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.612200Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:7653b986cd5d222707a099b5fca9ea7d6787dac19c953a6e0617d73a04d70eb8","observation_id":"09c2b0af-e638-4a32-88da-12c53adbc512","resolution":{"observed_at":"2026-08-15T17:51:16.612200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10981","last_updated":"2024-08-23T00:17:02Z","snapshot_observed_at":"2026-08-14T10:51:21.055151Z","submitted_at":"2024-04-17T01:27:42Z","title":"A Survey on Retrieval-Augmented Text Generation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10981","snapshot_observed_at":"2026-08-15T17:51:16.616754Z","title":"A survey on retrieval-augmented text generation for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.616754Z"},"links":{"cited_paper":"/paper/2404.10981","citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:bf5c830d7fe9188261776059383119bf7b61732594f9eab42fcc845f8bbbca69","observation_id":"fe708efe-721b-44df-a740-84d2c62d4573","resolution":{"observed_at":"2026-08-15T17:51:16.616754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:17.295521Z","title":"Jieba Chinese text segmentation","venue":null,"work_id":"bbca79ce-e457-41a0-bc85-b71b396c79de","year":2012},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.621083Z"},"links":{"citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:f8c6c0da3173f05f3b999d92d4f8d5ee3407c7e158b6bd9e2683772f50b02028","observation_id":"8cd63b7e-5e07-44f3-8f5b-77e4685657c2","resolution":{"observed_at":"2026-08-15T17:51:17.299339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21910","last_updated":"2025-03-27T18:41:21Z","snapshot_observed_at":"2026-08-14T20:08:22.485881Z","submitted_at":"2025-03-27T18:41:21Z","title":"JEEM: Vision-Language Understanding in Four Arabic Dialects","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21910","snapshot_observed_at":"2026-08-15T17:51:16.624934Z","title":"JEEM: Vision-Language Understanding in Four Arabic Dialects , 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.624934Z"},"links":{"cited_paper":"/paper/2503.21910","citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:eb47f37d374aafd3a26b3efe8348d9505f537e2af0feb5c21990e23b99020e13","observation_id":"e3736bd0-a3b5-4a49-80ed-ab15cf9f287b","resolution":{"observed_at":"2026-08-15T17:51:16.624934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20204","last_updated":"2024-06-26T12:31:48Z","snapshot_observed_at":"2026-08-16T00:59:58.887636Z","submitted_at":"2024-05-30T16:07:54Z","title":"Jina CLIP: Your CLIP Model Is Also Your Text Retriever","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20204","snapshot_observed_at":"2026-08-15T17:51:16.629099Z","title":"Jina CLIP: Your CLIP Model Is Also Your Text Retriever , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.629099Z"},"links":{"cited_paper":"/paper/2405.20204","citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:ab3c46e0d562d4ae09695e3ccc34a5dbc2a443f1fcf457bdc99df7c25a884d0a","observation_id":"33061be7-7d06-4e84-8641-a6c5f7f813a7","resolution":{"observed_at":"2026-08-15T17:51:16.629099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:17.286035Z","title":"MeCab: Yet Another Part-of-Speech and Morphological Analyzer","venue":null,"work_id":"3355b5e1-4ab3-4d17-af42-44f2ca1059d7","year":2006},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.632935Z"},"links":{"citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:d25b2ba2d461376e399987536223e30c922e702356552a5563837c6e47e38fa4","observation_id":"fd59b8a9-4a33-46f3-b852-e12dc5597075","resolution":{"observed_at":"2026-08-15T17:51:17.289332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:17.276160Z","title":"The IndicNLP Library","venue":null,"work_id":"f0de6498-43ce-45e2-b848-059afe98caa5","year":2020},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.636690Z"},"links":{"citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:d7beb6910208e5287b01a79629103dd70b2d1eee574e12458c417d7474689c16","observation_id":"0dcfd769-727d-4592-9c0e-202d19b25e9c","resolution":{"observed_at":"2026-08-15T17:51:17.279721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:16.640675Z","title":"What matters when building vision-language models? Advances in Neural Information Processing Systems, 37: 0 87874--87907, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.640675Z"},"links":{"citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:eafb1a6076835c708cb934ce9dd5df999c30396f5279f9f31502cc54a991c9b0","observation_id":"c7a22470-775d-43e5-9b8d-5d0631d8897b","resolution":{"observed_at":"2026-08-15T17:51:16.640675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:17.259893Z","title":"u ttler, Mike Lewis, Wen-tau Yih, Tim Rockt\\","venue":null,"work_id":"d19960aa-d4d8-430e-b168-b7d7f5728d5d","year":2020},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.644569Z"},"links":{"citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:7b4780a6732c2d1d678da38f3e7c52ebf46e905ad6483ece4ebb720419871cee","observation_id":"faa9f74a-0fa5-4724-a853-9082954a96ac","resolution":{"observed_at":"2026-08-15T17:51:17.263507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:17.249603Z","title":"Evcap: Retrieval-augmented image captioning with external visual-name memory for open-world comprehension","venue":null,"work_id":"5deba12c-0286-43d1-9b19-d8da2d270e0e","year":2024},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.648440Z"},"links":{"citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:2b7f27e848523a0d73c8b549fa98b902c9014506cb1c49f345895cb69d1c58e9","observation_id":"517d34f0-010d-46e9-8aaf-1d6de556f505","resolution":{"observed_at":"2026-08-15T17:51:17.253454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-15T17:51:16.652000Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.652000Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:a8d92f047ecabd5197f143afd3c0e29d73c58520140be5b2ec8ab17ddd5cb48c","observation_id":"74afd818-a77f-403c-8703-2959bce25ead","resolution":{"observed_at":"2026-08-15T17:51:16.652000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02265","last_updated":"2024-08-06T10:10:58Z","snapshot_observed_at":"2026-08-12T23:50:34.364351Z","submitted_at":"2024-06-04T12:41:54Z","title":"Understanding Retrieval Robustness for Retrieval-Augmented Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02265","snapshot_observed_at":"2026-08-15T17:51:16.656228Z","title":"Understanding retrieval robustness for retrieval-augmented image captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.656228Z"},"links":{"cited_paper":"/paper/2406.02265","citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:98c424fb58829e1ad40952e616074e2418bab3c92494cacd54b8d472743efe02","observation_id":"e7874f0f-5989-4824-b5ef-fc0ce10a10bf","resolution":{"observed_at":"2026-08-15T17:51:16.656228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10668","last_updated":"2022-11-10T07:01:42Z","snapshot_observed_at":"2026-08-13T05:35:34.752896Z","submitted_at":"2021-12-20T16:52:35Z","title":"Few-shot Learning with Multilingual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10668","snapshot_observed_at":"2026-08-15T17:51:16.660499Z","title":"Few-shot learning with multilingual language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.660499Z"},"links":{"cited_paper":"/paper/2112.10668","citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:6a5949657d78620c7e29dc99fcce106e461d1be73e63d639daae81b75b3bc33f","observation_id":"81a63aee-6015-44d3-8eac-4a2bdcc64d73","resolution":{"observed_at":"2026-08-15T17:51:16.660499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:17.239410Z","title":"Visual Instruction Tuning","venue":null,"work_id":"f22fcd14-910b-45fa-be2d-d0b9730305ba","year":2023},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.664943Z"},"links":{"citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:be6b7819dd22285d84430e7c6eea4bc778b194daf7f0f1c7cd5f757612a52c55","observation_id":"f8bb8130-295a-4539-86fb-3a3060895571","resolution":{"observed_at":"2026-08-15T17:51:17.242606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:17.228661Z","title":"LLaVA-NeXT: Improved reasoning, OCR, and world knowledge , January 2024","venue":null,"work_id":"0c0c7778-76fd-46ca-acc7-ce2566bfc315","year":2024},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.668652Z"},"links":{"citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:d5d8fbe2033109d534a31e1faab958dfa3e2893348fab1481474c0d8c78dd53d","observation_id":"fadedef2-a003-4e9f-9924-bdd11e7842db","resolution":{"observed_at":"2026-08-15T17:51:17.232573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.nlposs-1.7","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:16.814831Z","title":"fugashi, a tool for tokenizing J apanese in python","venue":null,"work_id":"799396ad-546a-4e74-9f27-eb23b520900a","year":2020},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.672148Z"},"links":{"citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:73d8aca887c2e6d9c9312186ca6fca19178f6ab75696d76deb8d5a844ca9267b","observation_id":"14378ac8-bae8-4aae-8198-fc83ac36b32a","resolution":{"observed_at":"2026-08-15T17:51:16.819538Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-08-13T13:33:48.501765Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-15T17:51:16.675792Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.675792Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:b3488b6e3632d18031ee801b60bc5dc94e351e10ceb4bfd83b8455df8a50a1cb","observation_id":"5f30e3c7-ca49-4e1e-b8d7-3dbba3b0fcc1","resolution":{"observed_at":"2026-08-15T17:51:16.675792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01786","last_updated":"2023-05-29T16:40:37Z","snapshot_observed_at":"2026-08-14T23:23:23.284660Z","submitted_at":"2022-11-03T13:19:32Z","title":"Crosslingual Generalization through Multitask Finetuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01786","snapshot_observed_at":"2026-08-15T17:51:16.679464Z","title":"Crosslingual Generalization through Multitask Finetuning , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.679464Z"},"links":{"cited_paper":"/paper/2211.01786","citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:69cfef5ce0962dc219eddd4996d2feb7a016e723a0264ba626f764da65b956f2","observation_id":"51b04839-ec5b-4803-9217-1de436dbe949","resolution":{"observed_at":"2026-08-15T17:51:16.679464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-15T17:51:16.683396Z","title":"GPT-4o System Card , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.683396Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:cdf0ec35ae0aa036bbc76b7aa46411bdbd765cbf2c3bdbfa71faa1b9d1c1c07b","observation_id":"e1ea91a9-9c40-41a8-953c-93c3e9a78fd3","resolution":{"observed_at":"2026-08-15T17:51:16.683396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18799","last_updated":"2024-09-09T16:00:04Z","snapshot_observed_at":"2026-08-13T05:13:00.677763Z","submitted_at":"2023-11-30T18:43:51Z","title":"X-InstructBLIP: A Framework for aligning X-Modal instruction-aware representations to LLMs and Emergent Cross-modal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18799","snapshot_observed_at":"2026-08-15T17:51:16.687278Z","title":"X-InstructBLIP: A framework for aligning x-modal instruction-aware representations to llms and emergent cross-modal reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.687278Z"},"links":{"cited_paper":"/paper/2311.18799","citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:b248daab32b4603a563ed61532c801c427857802ba597277d60a523c0ee66351","observation_id":"74b74614-b132-4d43-ad93-f59553198c90","resolution":{"observed_at":"2026-08-15T17:51:16.687278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:16.690863Z","title":"BLEU: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.690863Z"},"links":{"citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:d50d87b93d97921127d802cf0c54856879de6821e604cb99e28cf54354c022b9","observation_id":"4afd289a-bc32-4e9b-9e69-9ba034fdd7c7","resolution":{"observed_at":"2026-08-15T17:51:16.690863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:17.216254Z","title":"P y T hai NLP : T hai natural language processing in P ython, June 2024","venue":null,"work_id":"24b47f59-85b4-48b1-a084-2e5b95754c25","year":2024},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.694081Z"},"links":{"citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:18592978d8d33c514f838ad23172287d37579c1871a9241e83fa0223918257f2","observation_id":"8f4cda7b-4054-4873-aff6-45af173add3a","resolution":{"observed_at":"2026-08-15T17:51:17.221933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-15T17:51:16.698048Z","title":"Learning Transferable Visual Models From Natural Language Supervision , 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.698048Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:8cacd1ccee0598f5a7696ef77b016fbbe55b241d090c9390a759115baf97f762","observation_id":"910c2351-826b-4f7b-9d9a-dfe03e42fa35","resolution":{"observed_at":"2026-08-15T17:51:16.698048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-acl.104","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:16.801437Z","title":"LMC ap: Few-shot multilingual image captioning by retrieval augmented language model prompting","venue":null,"work_id":"6c2c5fad-4c42-4509-aa54-2e8db6a26a8d","year":2023},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.701713Z"},"links":{"citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:8a90ebed276afe9202241346d48ee42ad5757cdb7c7ecc61d3aacf62c99c5a2c","observation_id":"3d508bb6-c1f8-4088-8ddc-3708d4d07367","resolution":{"observed_at":"2026-08-15T17:51:16.807453Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:17.204966Z","title":"SmallCap : Lightweight image captioning prompted with retrieval augmentation","venue":null,"work_id":"7061c647-8228-435b-b21f-22eb4a33dc2d","year":2023},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.705022Z"},"links":{"citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:33e7b8ce43dc2f63d6256d41bf51704271af0606a06d69cd125e6639ef89ac65","observation_id":"1417952e-efa7-4b22-af52-96deeef79851","resolution":{"observed_at":"2026-08-15T17:51:17.208661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:17.193440Z","title":"PAELLA : Parameter-efficient lightweight language-agnostic captioning model","venue":null,"work_id":"e73a19fa-6946-48aa-8366-027f3dd06fea","year":2024},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.708324Z"},"links":{"citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:783630ae8ed12f2ba6de5160eaa6c455efc41e5fcb5e35871319dd2f6b396180","observation_id":"ee0ff7e6-5416-4f46-b12b-be8e792b8ad5","resolution":{"observed_at":"2026-08-15T17:51:17.197085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:17.182130Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":"195e5bfb-50ca-4fce-a6ce-ef3f87dba560","year":2018},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.711713Z"},"links":{"citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:aa0c925ec1e65c1c2b7d55e2d9dae6fe1ec92f099c92982d5c7493906391f5dd","observation_id":"348fd5ae-21c5-4771-bf9e-add921b3b67b","resolution":{"observed_at":"2026-08-15T17:51:17.186408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:17.170430Z","title":"Stanford Alpaca: An instruction-following LLaMA model , 2023","venue":null,"work_id":"62b024b7-e764-42ec-ab50-c8d281911765","year":2023},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.715464Z"},"links":{"citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:afc9503dad285945ede3ca14cc64df130b788c1ff0c7d26d58df5df22a03c149","observation_id":"0b5cf44d-1522-4951-a8d2-79e1cdaf2a25","resolution":{"observed_at":"2026-08-15T17:51:17.174255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:16.719471Z","title":"Thapliyal, Jordi Pont Tuset, Xi Chen, and Radu Soricut","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.719471Z"},"links":{"citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:99a731783638864ebb0fa7bd15c94c00067909b94226dc3cb05cd868c5b357f3","observation_id":"ebd4d8dd-71aa-4cc6-b4ca-184996c1f9ce","resolution":{"observed_at":"2026-08-15T17:51:16.719471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T17:51:16.722756Z","title":"LLaMA: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.722756Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:d066ef972bb336578a30aa55108f7069be53e0091a2a5523e719c92939e34560","observation_id":"3daa7291-0601-4c6a-87b9-5db7461ab864","resolution":{"observed_at":"2026-08-15T17:51:16.722756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-15T17:51:16.726343Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features , 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.726343Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:45b4f461b6a0b892e11c68a93aedbc155d6adb5910e6bded5a96512a3f1d99b9","observation_id":"f6a6cb77-0ca8-4be7-956e-aebe5d0cdd46","resolution":{"observed_at":"2026-08-15T17:51:16.726343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1411.5726","last_updated":"2015-06-03T01:42:20Z","snapshot_observed_at":"2026-08-14T23:10:48.763001Z","submitted_at":"2014-11-20T23:54:35Z","title":"CIDEr: Consensus-based Image Description Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.5726","snapshot_observed_at":"2026-08-15T17:51:16.729976Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.729976Z"},"links":{"cited_paper":"/paper/1411.5726","citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:bbbfc3923c9dfd33b2793ed2a18e0b324c9ebf8ac6b5a1d4f9a3bdc306812178","observation_id":"afa3a0b6-b36e-42fa-9d3e-fa14adb62fdd","resolution":{"observed_at":"2026-08-15T17:51:16.729976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11934","last_updated":"2021-03-11T18:45:13Z","snapshot_observed_at":"2026-08-15T13:30:47.746059Z","submitted_at":"2020-10-22T17:58:14Z","title":"mT5: A massively multilingual pre-trained text-to-text transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11934","snapshot_observed_at":"2026-08-15T17:51:16.733490Z","title":"mT5 : A massively multilingual pre-trained text-to-text transformer","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.733490Z"},"links":{"cited_paper":"/paper/2010.11934","citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:f1f0d0c5f9061b2f4d1793af9d8346047d1155e37ea164b65a90a0b50181d5b9","observation_id":"b1049281-ed97-4bca-9353-afbc0cf6d975","resolution":{"observed_at":"2026-08-15T17:51:16.733490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12561","last_updated":"2023-06-06T00:28:34Z","snapshot_observed_at":"2026-08-13T13:37:08.088461Z","submitted_at":"2022-11-22T20:26:44Z","title":"Retrieval-Augmented Multimodal Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12561","snapshot_observed_at":"2026-08-15T17:51:16.736921Z","title":"Retrieval-augmented multimodal language modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.736921Z"},"links":{"cited_paper":"/paper/2211.12561","citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:dbae517656ab79bca1da56c31020b11c3ea4d62ddb166640c53672b6f595726a","observation_id":"bc8b0d94-0737-4c43-a615-beb1341521ce","resolution":{"observed_at":"2026-08-15T17:51:16.736921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16153","last_updated":"2025-01-26T15:34:59Z","snapshot_observed_at":"2026-08-12T22:59:25.550697Z","submitted_at":"2024-10-21T16:19:41Z","title":"Pangea: A Fully Open Multilingual Multimodal LLM for 39 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16153","snapshot_observed_at":"2026-08-15T17:51:16.740304Z","title":"Pangea: A Fully Open Multilingual Multimodal LLM for 39 Languages , 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.740304Z"},"links":{"cited_paper":"/paper/2410.16153","citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:93e497ef3e66bab35f698b7fcc0d5033f6274381095697c7230fa697a062ed49","observation_id":"b0f06c3a-7cae-4d47-8a28-c71914589cdc","resolution":{"observed_at":"2026-08-15T17:51:16.740304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:17.158200Z","title":"MeaCap: Memory-augmented zero-shot image captioning","venue":null,"work_id":"1df6b5ac-d885-4da8-b62a-656838bdcd9e","year":2024},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.744297Z"},"links":{"citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:1981ed919bdce8dfa7597710de5f6927cda540dd89eadfbac2a7580c65d9de5d","observation_id":"61bf576e-1c58-47fb-964e-63ef406e5c32","resolution":{"observed_at":"2026-08-15T17:51:17.162716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:17.148005Z","title":"Scaling vision transformers","venue":null,"work_id":"2506d36b-9fdc-4e98-8788-378194843bff","year":2022},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.747605Z"},"links":{"citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:8537a0edaa8f7b4caba34b01a260b50bfec41c006e13718f3eb6b175cc0d3564","observation_id":"a668557f-71c6-444b-9443-b16a5e1139cc","resolution":{"observed_at":"2026-08-15T17:51:17.151494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15343","snapshot_observed_at":"2026-08-15T17:51:16.750717Z","title":"Sigmoid Loss for Language Image Pre-Training , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.750717Z"},"links":{"cited_paper":"/paper/2303.15343","citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:49c9c120d4c94c542b616400d639cf6323d832dc236ccaa95441c708e4cced36","observation_id":"222e58a0-d79d-4940-8502-f02eb0b2b441","resolution":{"observed_at":"2026-08-15T17:51:16.750717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:16.754102Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.754102Z"},"links":{"citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:0fe603453c7d5358441fd75caaf0552c969af7f01c75a641312f89075f078a59","observation_id":"02e3af54-5b06-47c0-aa73-30d05a6e3708","resolution":{"observed_at":"2026-08-15T17:51:16.754102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:16.758121Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.758121Z"},"links":{"citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:9254338d4cc5b8aad914588c832dc3b203011f89b0f5e34dad3fd47ba06aec0f","observation_id":"3a7dcc8f-acfc-4615-a000-b301174eea7b","resolution":{"observed_at":"2026-08-15T17:51:16.758121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:16.761894Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.761894Z"},"links":{"citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:289d4528b3b84323ab62944534ffc71cd580a35c6a5449aa7a016954f6523e21","observation_id":"f4ab3af3-559a-407a-85ce-f38e069fd2e4","resolution":{"observed_at":"2026-08-15T17:51:16.761894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:51:16.765188Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T17:51:16.765188Z"},"links":{"citing_paper":"/paper/2507.20411"},"observation_digest":"sha256:81a0b2f713199c660b9e27c3d24648ae1a5bb64d926148c1ecddbea788057e35","observation_id":"fc570287-e508-4ad7-90fb-4fe2b8459c0c","resolution":{"observed_at":"2026-08-15T17:51:16.765188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.20411","last_updated":"2025-07-27T21:00:02Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T17:41:18.595966Z","submitted_at":"2025-07-27T21:00:02Z","title":"CONCAP: Seeing Beyond English with Concepts Retrieval-Augmented Captioning"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":2,"verified_fuzzy":19},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2507.20411."}