{"as_of":"2026-08-08T13:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cfac89f9f5bee5532e31e5680d13485a1cba1c30fe8cd4716da93ea1f93df856","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:55:45.393061Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.09014/citation-record","integrity":"/paper/2509.09014/integrity","json":"/paper/2509.09014/citation-record.json","paper":"/paper/2509.09014"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.189833Z","title":"Generative image captioning in urdu using deep learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.189833Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:fd030db736827dc932a106dfe2fe32e18292d6d2237601d2b0a502cd099a0378","observation_id":"cf238843-15a3-4932-bf0c-07d976e37d14","resolution":{"observed_at":"2026-08-04T19:55:44.189833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.208048Z","title":"A transformer-based urdu image caption generator.Journal of Computational Linguistics, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.208048Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:5ce989a8722806e8f0b280205c328eb1edffbf6a6e67b8f5f74005772aa988e3","observation_id":"b0799bed-7272-4992-a4b0-fea0b94bf682","resolution":{"observed_at":"2026-08-04T19:55:44.208048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.250926Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.250926Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:99cc4056f5cd3de57ad953dcdff2fe3420b0227a80b6e288475c853ab50fabf7","observation_id":"69b9f292-de18-4277-9490-cd73cedb2001","resolution":{"observed_at":"2026-08-04T19:55:44.250926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.284388Z","title":"Massively multilingual sentence embeddings for zero-shot cross-lingual transfer and beyond.Transactions of the association for computational linguistics, 7:597–610, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.284388Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:416ac5e3a9485efe2be370d4989a91f4c282ce46245328d923ac06660d31cfac","observation_id":"f95e35aa-83cc-44bf-ae9b-bb7fc0eaba99","resolution":{"observed_at":"2026-08-04T19:55:44.284388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-04T19:55:44.314288Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.314288Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:8ff65ac2cdaa8fc556aff6139292ac99aeb6830e4c9b3a36dcbb6e371d9bb8a3","observation_id":"412fac42-dd76-47e0-8e04-7c8367c1118f","resolution":{"observed_at":"2026-08-04T19:55:44.314288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.355029Z","title":"Multilingual vision-and-language representation learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.355029Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:a628a88422e06a839fbce81f7f166535becdca63137e00a4a68b904f90f22ddb","observation_id":"f012383d-d653-4afe-8cb4-46cd079c9e79","resolution":{"observed_at":"2026-08-04T19:55:44.355029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-04T19:55:44.391146Z","title":"Palm: Scaling language modeling with pathways.arXiv preprint arXiv:2204.02311, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.391146Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:d3da22831e7a9d45a3b106da683c6ca89145ae0129e6b040293aca19782198d2","observation_id":"9e1ee3ac-b78b-48ae-a9fe-50ace34cb8ed","resolution":{"observed_at":"2026-08-04T19:55:44.391146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11596","last_updated":"2023-10-25T03:52:07Z","snapshot_observed_at":"2026-07-06T16:09:09.018523Z","submitted_at":"2023-08-22T17:44:18Z","title":"SeamlessM4T: Massively Multilingual & Multimodal Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11596","snapshot_observed_at":"2026-08-04T19:55:44.451788Z","title":"Seamlessm4t: Massively multilingual & multimodal machine translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.451788Z"},"links":{"cited_paper":"/paper/2308.11596","citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:9d22b21ef4ece02bf33334f32e6ec3de55133bdbb2b077e8ca92f53d06330321","observation_id":"4f49463e-9c2f-497d-bcfe-dc27fbb6d5db","resolution":{"observed_at":"2026-08-04T19:55:44.451788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04672","last_updated":"2022-08-25T17:10:53Z","snapshot_observed_at":"2026-07-06T13:29:47.927628Z","submitted_at":"2022-07-11T07:33:36Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.04672","snapshot_observed_at":"2026-08-04T19:55:44.486223Z","title":"No language left behind: Scaling human-centered machine translation.arXiv preprint arXiv:2207.04672, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.486223Z"},"links":{"cited_paper":"/paper/2207.04672","citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:5f55af6275507348a4a1691ddd402823b979e5b43bcff9cb49e8fe1cd7db6e20","observation_id":"e17d1073-0eac-4c12-9bef-65206112c9b5","resolution":{"observed_at":"2026-08-04T19:55:44.486223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.528542Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.528542Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:06834eac9e4121b9625d82360668dc81123d39ebcb84ccde5636dec3f687a65c","observation_id":"761ae009-fb96-41e4-b91b-72861c82274f","resolution":{"observed_at":"2026-08-04T19:55:44.528542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.01663","last_updated":"2021-06-19T15:31:55Z","snapshot_observed_at":"2026-08-08T11:50:13.122665Z","submitted_at":"2020-08-02T17:22:33Z","title":"Efficient Urdu Caption Generation using Attention based LSTM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.01663","snapshot_observed_at":"2026-08-04T19:55:44.553540Z","title":"Efficient urdu caption generation using attention based lstm","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.553540Z"},"links":{"cited_paper":"/paper/2008.01663","citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:91e6a98c4ca175b10bc7f470334ad9bf53eabd9f3f07314301bb4d7ba82e7e4f","observation_id":"a3190854-0045-44e9-9e56-2607d8f1126c","resolution":{"observed_at":"2026-08-04T19:55:44.553540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.613957Z","title":"Openclip: An open-source reimplementation of clip.https://github.com/mlfoundations/open_clip, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.613957Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:79ba1b00968467b9a0f68dd35a55d732988613c0b4288909d087c200ab21add9","observation_id":"38220436-2ae6-4dff-b2a2-38e5ed328956","resolution":{"observed_at":"2026-08-04T19:55:44.613957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.630163Z","title":"Johnson and Taghi M","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.630163Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:0796a15217a7802b6a852044dd41329061eba844e3497fd5b819a97e6628ee03","observation_id":"b1bdf49f-fab3-4b9b-9649-618640825473","resolution":{"observed_at":"2026-08-04T19:55:44.630163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.671413Z","title":"The state and fate of linguistic diversity and inclusion in the nlp world","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.671413Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:680b1f02e684eca0c226bb5b62c1b219b829d7b7545bb77d92bf3512533b027b","observation_id":"40a9a5a2-5d33-468e-abc5-2e420c058ec5","resolution":{"observed_at":"2026-08-04T19:55:44.671413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01234","last_updated":"2023-12-27T17:54:38Z","snapshot_observed_at":"2026-08-06T03:25:58.931434Z","submitted_at":"2023-03-01T06:04:25Z","title":"Frauds Bargain Attack: Generating Adversarial Text Samples via Word Manipulation Process","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01234","snapshot_observed_at":"2026-08-04T19:55:44.707367Z","title":"Scaling laws do not scale for low-resource languages.arXiv preprint arXiv:2303.01234, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.707367Z"},"links":{"cited_paper":"/paper/2303.01234","citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:7d36d837a5922400daed10502f620cca2ec1810a951bda6e183163f02bde94ab","observation_id":"19866d74-863f-433c-89fa-acc9a7e10ee3","resolution":{"observed_at":"2026-08-04T19:55:44.707367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.739787Z","title":"Bilingual–visual consistency for multimodal neural machine translation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.739787Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:04ad96bdfb96187e6ab9bcf9f20a2c8175e5d31a9ff000260c957cfbba9e4130","observation_id":"e822431a-e00b-4762-99b7-35c1651b7244","resolution":{"observed_at":"2026-08-04T19:55:44.739787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.779330Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.779330Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:ab61b96d275dd363fe47aa7f3e19a2094f8eb38f57c0ad5785ab017ee8f4489a","observation_id":"c215330a-41ba-4162-8b3f-fbaade13bba9","resolution":{"observed_at":"2026-08-04T19:55:44.779330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.789861Z","title":"Aligning visual and textual concepts for multimodal learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.789861Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:255ff8724a9e1a673a0c846160d5896929d64f28fa6849acf86910868d7e7dfa","observation_id":"613faa33-9b50-45f2-9aa2-f476fca1d54c","resolution":{"observed_at":"2026-08-04T19:55:44.789861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1371/journal.pone.0320701","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uicd: A new dataset and approach for urdu image captioning","venue":"PLoS ONE","work_id":"3733a55d-6bae-441c-89fb-c6eaeef23653","year":2025},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.830277Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:bd0581f57730d09629a92d312de19cc95eaab501e0ce7d0e6f8470c9769b280d","observation_id":"3cf872c2-d760-4738-884e-0da5a743eaec","resolution":{"observed_at":"2026-08-04T19:58:32.135778Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.867358Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.867358Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:5ab0acf5f002059e9287acb26252ea152191578b118f2da3e3e19d64c6f7f328","observation_id":"dced8525-f0bd-4560-9348-c8a975fe5d9d","resolution":{"observed_at":"2026-08-04T19:55:44.867358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.902452Z","title":"chrf: character n-gram f-score for automatic mt evaluation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.902452Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:28112315aeecf23ed4cf84be4657ef08c5b50a468077f3dd9fae9cc24a039a3f","observation_id":"8f20581f-17a4-4361-be60-1f11f8525f05","resolution":{"observed_at":"2026-08-04T19:55:44.902452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:44.964637Z","title":"A call for clarity in reporting bleu scores","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.964637Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:784c7134aa0981333473f5826da1780138b7da57d22a556182cb4d7b01d242fb","observation_id":"5156d792-d626-4b96-b803-f9549b618f5c","resolution":{"observed_at":"2026-08-04T19:55:44.964637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-04T19:55:44.981165Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:44.981165Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:975af8a7af8d26ff99c981d48c6bd5d2f9c4e84586cdef17d99dc8b4e01d27d1","observation_id":"23176506-0055-4a25-8339-8f3febc714d7","resolution":{"observed_at":"2026-08-04T19:55:44.981165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:45.022661Z","title":"The impact of translating resource-rich datasets to low-resource languages.ACL Findings, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:45.022661Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:efea42a85f775b216d342d613569e98988c377877dab160a952dc1dc08c53dca","observation_id":"e5887033-193b-43fc-b227-28d6d633d488","resolution":{"observed_at":"2026-08-04T19:55:45.022661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:45.067556Z","title":"Comet: A neural framework for mt evaluation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:45.067556Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:86b8d37e535b7659984b8ecd7159582d0d671329a1172396e420532e2fdf5bf3","observation_id":"86ec481c-a153-4526-84f7-9a7e136153c7","resolution":{"observed_at":"2026-08-04T19:55:45.067556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:45.091717Z","title":"A dataset for movie description","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:45.091717Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:4b0993c95ad4438e7b0f29b6db9cc803e06ab61e4525433fc3d398ec6580477b","observation_id":"e2f6ff27-f8ae-45b3-8317-ce790bf9106e","resolution":{"observed_at":"2026-08-04T19:55:45.091717Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.13958","last_updated":"2020-04-29T05:01:32Z","snapshot_observed_at":"2026-08-05T02:26:08.731160Z","submitted_at":"2020-04-29T05:01:32Z","title":"Optical parametric oscillation in silicon carbide nanophotonics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.13958","snapshot_observed_at":"2026-08-04T19:55:45.117651Z","title":"Beyond english-centric multilingual nlp.arXiv preprint arXiv:2004.13958, 2020","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:45.117651Z"},"links":{"cited_paper":"/paper/2004.13958","citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:ef45a83a6629076c36f5f7c8960461e1e108ce8b3fd453d42d6ccd70ca3f198b","observation_id":"65938e06-3da3-4d8a-a3ab-524c75e10b03","resolution":{"observed_at":"2026-08-04T19:55:45.117651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:45.158899Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:45.158899Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:aa24928c8faba79072bb8767ec7ec528e6d947abf953bb2aad2a25db1f5d9c52","observation_id":"33b03155-51a5-4b2b-af5a-d565f47668c1","resolution":{"observed_at":"2026-08-04T19:55:45.158899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:45.176389Z","title":"On the stratification of multi-label data","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:45.176389Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:5c311a75de803845079b9804f737eeb00b18b247701b2a516d5e1ddcbba2efc5","observation_id":"bed9bb90-4d1d-409d-b561-7c95c7ffb191","resolution":{"observed_at":"2026-08-04T19:55:45.176389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:45.210380Z","title":"Multimodal quality estimation for machine translation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:45.210380Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:009cb26e2ae8b83b47fe6bc918d6f531a7139c2513d65864ad4c5c8f4eb2832c","observation_id":"8cdebaad-445c-4929-8658-ec63b1abe38b","resolution":{"observed_at":"2026-08-04T19:55:45.210380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-04T19:55:45.246349Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:45.246349Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:f515edd3a26cd97a9c84c82f23adede47f4fb3571044ddaff54b4165cfb4dbc3","observation_id":"257041e6-933e-4584-8d12-df305798b660","resolution":{"observed_at":"2026-08-04T19:55:45.246349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:45.277507Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:45.277507Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:f46c168e3a4c1237cb00084241dc76e2abe32a03e60068d1ab9746eccf618e51","observation_id":"e54a9fe0-19ed-4763-893e-f041f72cd8cb","resolution":{"observed_at":"2026-08-04T19:55:45.277507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:45.287808Z","title":"Cliptrans: Transferring visual knowledge with pre-trained models for multimodal machine translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:45.287808Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:31e3e55cab6641a857ef707658761d5b2de5a5cb6214764062d394f49c055b1e","observation_id":"e7bec6f6-5fc6-4679-8cd6-f86de57138a7","resolution":{"observed_at":"2026-08-04T19:55:45.287808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15237","last_updated":"2022-05-30T16:52:30Z","snapshot_observed_at":"2026-07-06T13:15:32.315247Z","submitted_at":"2022-05-30T16:52:30Z","title":"VLUE: A Multi-Task Benchmark for Evaluating Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15237","snapshot_observed_at":"2026-08-04T19:55:45.328993Z","title":"When does clip generalize better than unimodal models?arXiv preprint arXiv:2205.15237, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:45.328993Z"},"links":{"cited_paper":"/paper/2205.15237","citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:43f160cd460fb4412415206d2c6e0fe84dbc9e7ce856d57c1f61cf6d07e4aeab","observation_id":"15c4100e-016c-4368-80db-689ce493fb20","resolution":{"observed_at":"2026-08-04T19:55:45.328993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:55:45.361226Z","title":"Mobileclip: Fast image-text models for on-device multimodal learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:45.361226Z"},"links":{"citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:bf5c995babd10ed1d6679bfc13a0bb27ad1ecccdafc2be914cacfe3a3dfbc61a","observation_id":"53b7023a-8f04-42c7-a98f-af9f2d3d779f","resolution":{"observed_at":"2026-08-04T19:55:45.361226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-04T19:55:45.393061Z","title":"Weinberger, and Yoav Artzi","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T19:55:45.393061Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2509.09014"},"observation_digest":"sha256:11beceee8ff96f4f0a5209a1d68cc48e221b5493eaef2316bd3918fe0ac3280e","observation_id":"1c327785-7b05-44cd-8c5d-359a9fba4ad5","resolution":{"observed_at":"2026-08-04T19:55:45.393061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.09014","last_updated":"2025-09-10T21:17:32Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T18:52:07.541799Z","submitted_at":"2025-09-10T21:17:32Z","title":"COCO-Urdu: A Large-Scale Urdu Image-Caption Dataset with Multimodal Quality Estimation"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2509.09014."}