{"as_of":"2026-08-08T04:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f8352664bab2fd7e2afdeeec1ffe2f3e1fa120f5edac8a49e965d79a0d2239a","coverage":[{"denominator":130,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:06:47.276588Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.05399/citation-record","integrity":"/paper/2506.05399/integrity","json":"/paper/2506.05399/citation-record.json","paper":"/paper/2506.05399"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:45.732169Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:45.732169Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:dcc9c09fd605c5848584723e28ac43f9a2c8c4941c39fcfb000fbe1778688c96","observation_id":"e31d1667-c607-4941-a40a-c811f6d672f1","resolution":{"observed_at":"2026-08-07T11:06:45.732169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:45.856737Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:45.856737Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:86f0ba09ae770dafd578284f12b1e7b90345c398dc6a9748dbaa14c9559b9124","observation_id":"796d4df8-2c35-4242-b5d1-2e9e0bda0019","resolution":{"observed_at":"2026-08-07T11:06:45.856737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:45.989581Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:45.989581Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:e98481a49d9df1ec7638566f7eaa052c51b8d34cc04be9661ff1fa2e30e00fa9","observation_id":"d700824e-ecf6-4da8-99f4-0a29050a0010","resolution":{"observed_at":"2026-08-07T11:06:45.989581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:46.109963Z","title":"Cheikh, M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:46.109963Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:8c25a951b4ae7649cc21399f8e77c00cd33d0b05051ec549313d630a54d6f4b0","observation_id":"a0dbf411-cfa0-4c88-a0ff-5944fb775fc8","resolution":{"observed_at":"2026-08-07T11:06:46.109963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:46.230821Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:46.230821Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:4a125138caa093598b64202bc197e74e95e9acf4bf3c4210ae818a2c0c3f59fb","observation_id":"d2823724-3fe7-494e-80df-feeb311d06ae","resolution":{"observed_at":"2026-08-07T11:06:46.230821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:46.381114Z","title":"Biswas, M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:46.381114Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:949bbca376a0d16d87f6a6cc2e75abd3ff251b23be1e40720cef3115056cac06","observation_id":"87d32209-582d-4d2c-8b2e-b8bd14705e11","resolution":{"observed_at":"2026-08-07T11:06:46.381114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:46.432813Z","title":"Ghandi, H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:46.432813Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:e41b241d6e0b24c63a498bf3b3f42bb9be174531ba1c0ea5fd0aee202366cadf","observation_id":"3da1d028-a782-4f28-8c2a-c52c25949e20","resolution":{"observed_at":"2026-08-07T11:06:46.432813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:46.544188Z","title":null,"venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:46.544188Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:7950c0d0265638522acdd3b036d07b7a2902fa8da16966bea5ce719667ce79b0","observation_id":"f560d107-92f1-4ff7-bcd3-34534fb35640","resolution":{"observed_at":"2026-08-07T11:06:46.544188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:46.631760Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:46.631760Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:254aab0398f3794d72e3675e95889fbba3ba41fe1e004d70336a57295f990a54","observation_id":"b88827ea-1f08-4f31-99f4-afc39f371688","resolution":{"observed_at":"2026-08-07T11:06:46.631760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:46.773899Z","title":"Ayesha, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:46.773899Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:5e1ffdd4521278be1ad6ab0bf9b68df087bf82ef7ba3c49283b7adbf5798dbc5","observation_id":"ec42790f-277b-455d-bbfa-7155c4f45984","resolution":{"observed_at":"2026-08-07T11:06:46.773899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:46.837400Z","title":"Chendake, P","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:46.837400Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:e9122b1afc6dd0d24470ec0b26e95833fd309bdb5a0fb35f0aab56612bbdbcf9","observation_id":"2f41e7fc-9b15-4dca-8205-d4ecdbeb1037","resolution":{"observed_at":"2026-08-07T11:06:46.837400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:46.985632Z","title":"Ogura, N","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:46.985632Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:1f20e04f85335f0d93bb15c12249a87cae0f664d81bbc1ed285afd4b11f2d2bd","observation_id":"909a8c0e-8e78-41ed-bd1a-d47856027ddc","resolution":{"observed_at":"2026-08-07T11:06:46.985632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.052116Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.052116Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:61852ae38ef7ef1ca4dd7b8ba2244962ec338cc1b3ef51c92e85aefa174a3eb4","observation_id":"58ea0a78-b313-4180-9793-f2333157bf47","resolution":{"observed_at":"2026-08-07T11:06:47.052116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.056143Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.056143Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:22805d694efdc832df527015e1a4ecb8a33ca378ad8930fa9ce387117dd01690","observation_id":"0c83f6ae-1611-4e3d-bc67-7eec59aeb012","resolution":{"observed_at":"2026-08-07T11:06:47.056143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.059221Z","title":"Nivedita, P","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.059221Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:3016fc0e72d95c96a85c0bb8c91a35f8b32992fdda001b32db84d37de2223e1c","observation_id":"581d0eea-499d-4cc9-b4b5-7255c8eab00b","resolution":{"observed_at":"2026-08-07T11:06:47.059221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.062039Z","title":"Hoxha, F","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.062039Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:bf15b835a1739220f033bd485ffcff0f355be8953fabfaca73e1b1525383d7b4","observation_id":"42918578-e050-4142-af9a-4a68700be36a","resolution":{"observed_at":"2026-08-07T11:06:47.062039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.064445Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.064445Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:5d15d3ab1cc10c58767133267067975f4754449ec3c1f6be5a138c1165d30c99","observation_id":"b8944d82-b23d-4df5-92b0-e6a9ef01f171","resolution":{"observed_at":"2026-08-07T11:06:47.064445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.067166Z","title":"Shuster, S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.067166Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:73c507dd9b35983169a8a27972cc9754f49cea12e94c37543ac19145a315ee86","observation_id":"f830475a-4205-4284-8111-8852c8c0bfe3","resolution":{"observed_at":"2026-08-07T11:06:47.067166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.069702Z","title":"Fujiyoshi, T","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.069702Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:e7e1c49715bde6b4ad72850976eeadb7a1529f7191987027ffc514afdfcf85f7","observation_id":"3c26dbfd-96de-40e2-8884-2e1f830a1f90","resolution":{"observed_at":"2026-08-07T11:06:47.069702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.072089Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.072089Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:d20c0ede627233088248e0f50dcb1f73db566e9f9bc8b42a4fa1c7242fdd1f10","observation_id":"39580215-73bc-45d8-bd17-360a575da650","resolution":{"observed_at":"2026-08-07T11:06:47.072089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.075005Z","title":"Guinness, E","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.075005Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:7716b09925fc836d0b924418c2bab124ea8d042b3ef3cc1ed120e8145037ac50","observation_id":"0f5416d1-8e13-4b77-97a6-8400d3c191ce","resolution":{"observed_at":"2026-08-07T11:06:47.075005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.077470Z","title":"Huang, L","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.077470Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:09837bb16cd5569860c234d68473ab3628ba404c75fbf90beef5f3a8cf825d67","observation_id":"bb223326-f236-46f9-a0e5-726f27c40940","resolution":{"observed_at":"2026-08-07T11:06:47.077470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.079968Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.079968Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:d3ef33121b30d527e3e8f9295f8eccf727f1b14003d34ff3564a113fd473412c","observation_id":"17bf078f-fa13-4d63-94c3-c7433b235431","resolution":{"observed_at":"2026-08-07T11:06:47.079968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.082402Z","title":null,"venue":null,"work_id":null,"year":1914},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.082402Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:afc316704cb3588d60642738b7b98bf7791cee1631a16df3101fcda4e79f6f09","observation_id":"ea8b6d1c-6fb9-4e66-897f-34309a19fcaa","resolution":{"observed_at":"2026-08-07T11:06:47.082402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.084806Z","title":"Stefanini, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.084806Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:19bde527a42e4cf0ce3d1ac7538192c87fb41191c4a78cba4ea871110274e3eb","observation_id":"99f6ffe5-cb52-4280-9740-58f0331e8f8e","resolution":{"observed_at":"2026-08-07T11:06:47.084806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.087382Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.087382Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:b443ddf71062308882b78e0e199118863eca2ac8d9af22eea628561fad622dbb","observation_id":"cf9f890b-fc79-43cd-a145-328b8494036d","resolution":{"observed_at":"2026-08-07T11:06:47.087382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.089917Z","title":"Zohourianshahzadi, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.089917Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:017ba871047f63007a631616e4d7afaabf1f9601acac6c25b63c848165c8b6b8","observation_id":"ce7e20de-a04e-4eea-ac41-2bfb86283b6d","resolution":{"observed_at":"2026-08-07T11:06:47.089917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.092485Z","title":"Senior, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.092485Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:74c8030ceeb7479b09fa69b23a3a28e8048f3e57d977993f0e28d83351d2c907","observation_id":"c9ff94f4-660e-428a-8082-149689293c3b","resolution":{"observed_at":"2026-08-07T11:06:47.092485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.095068Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.095068Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:3c50d5b9ad702d9582719009b1b398a422afca8842e3f9d5041766349ddb792b","observation_id":"e8076348-cd81-408d-b8d8-5cccf75ce627","resolution":{"observed_at":"2026-08-07T11:06:47.095068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.097419Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.097419Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:0bd79696be4e3a76c2316ba8637d3aa5ca2cb64ef7abb3d0311cc23deb60af6a","observation_id":"c2164499-b758-4132-937d-23601e877e46","resolution":{"observed_at":"2026-08-07T11:06:47.097419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.099775Z","title":"Zohourianshahzadi, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.099775Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:cb39e5cedecbaea52204d61144b04b9667b2101124d818f6ed564ed785722eb0","observation_id":"ca513140-7afa-49c4-8d7b-176b433ae543","resolution":{"observed_at":"2026-08-07T11:06:47.099775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.102116Z","title":"Sharma, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.102116Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:27167a3f5c1425a70949ac6f8013a22e78a5be6f432529c95bac0bf1640d337e","observation_id":"60d621df-d0ae-4e16-9fd2-6ddea04f72f5","resolution":{"observed_at":"2026-08-07T11:06:47.102116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.104570Z","title":"Sharma, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.104570Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:99ec7772daca8d010b0cb9501eec3ccbb16349bf9d358a181ea3e9541e4b65c0","observation_id":"1c75a506-b961-4029-ade9-39a3bb1e08d9","resolution":{"observed_at":"2026-08-07T11:06:47.104570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.107285Z","title":"Sharma, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.107285Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:31f6dceef9b1fd335a5cf30aaa9f6995dba3224269c28b7714d6991e2b37c7f3","observation_id":"5aa6f582-04b8-4549-b29a-005df67ce2cf","resolution":{"observed_at":"2026-08-07T11:06:47.107285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.109659Z","title":"Oluwasammi, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.109659Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:b6f6333f83445736fab604b23ee7a124955d0527e666569bb1c4efee36ccaec1","observation_id":"28930ebe-d40d-4676-b578-52d96896a0c6","resolution":{"observed_at":"2026-08-07T11:06:47.109659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.112060Z","title":"Stani ¯ut˙e, D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.112060Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:6d51b7777a51bb14cd8aa8c89099c5e80e71dcf27a63a15e2edbe4544adb6d57","observation_id":"1058e88e-1099-4110-b2fa-a66aab4cf04a","resolution":{"observed_at":"2026-08-07T11:06:47.112060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.114775Z","title":"Sharma, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.114775Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:72bcb6151b2c8e56292044fc1b9ae5d7f413202938eaa41910f28b606f0b0e0a","observation_id":"27175948-a9f3-4ac6-ba65-0a02ff03fb12","resolution":{"observed_at":"2026-08-07T11:06:47.114775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.117681Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.117681Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:087ce1c7d128064594e291a2eb606afeef949c7bfda3f613a48d071f1e837f62","observation_id":"81dee965-d22d-4056-9cc6-c3fa031777c8","resolution":{"observed_at":"2026-08-07T11:06:47.117681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.120452Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.120452Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:fe6212dadd0cf9898a84f17c8654691b54a69cea91350c027286cd78d0f21297","observation_id":"17730e79-88e8-4a47-a202-c852ac036ce3","resolution":{"observed_at":"2026-08-07T11:06:47.120452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.10064","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.465294Z","title":"Thirunavukarasu, E","venue":null,"work_id":"965827b7-ba6e-4b7e-8c65-1d3b8510796c","year":2024},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.122846Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:1ec8331a30e6149e4861002b31c273961244c9325766ef011d3125b010504063","observation_id":"f1e558b1-30cd-4293-a30f-fc23dc89d591","resolution":{"observed_at":"2026-08-07T11:06:47.472016Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.125217Z","title":"Kotei, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.125217Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:aa1a6bd6705454865f4218ce8fe40a1fae3ba12d98b38a75d3671c310478d4b8","observation_id":"ba235712-f234-4ea4-8936-6b3b33ec38d5","resolution":{"observed_at":"2026-08-07T11:06:47.125217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.127759Z","title":"Zhao, A systematic survey of remote sensing image captioning, IEEE Access 9 (2021) 154086–154111","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.127759Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:7654bf02c4e8aa48955c5be0279d8c7a22a747986807248532db5f87d0a3267f","observation_id":"467d85f7-9ca8-4142-8c46-3d7a34b3df56","resolution":{"observed_at":"2026-08-07T11:06:47.127759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.130151Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.130151Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:36223c9e88884ad90fbb31322cd5625cf0d80bcebcdb58ff4a1756a2b6557218","observation_id":"39027d5b-5091-4f0a-8d59-366035da2e5c","resolution":{"observed_at":"2026-08-07T11:06:47.130151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.132896Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.132896Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:779e443eda3f8bacb7968fecad36cc92e5e9756c81a0ca2be26aa590ea5fddb1","observation_id":"69668cbb-ff06-4876-95ba-d807ecfaceaa","resolution":{"observed_at":"2026-08-07T11:06:47.132896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.135346Z","title":"Zhang, H","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.135346Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:62a773713740a96a4a6655e2c0dee0324a61d07b1f8772d4ce472526dceb86fd","observation_id":"23411363-90c2-426e-83a4-b20304b7dfb2","resolution":{"observed_at":"2026-08-07T11:06:47.135346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.138019Z","title":"Vaswani, N","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.138019Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:dde1bd5004ee12fd50f805aa75fd7551a27a84cef63484b10811d7d455827c1d","observation_id":"5f1da28c-a083-4dfb-b193-7bf8e4f4ad45","resolution":{"observed_at":"2026-08-07T11:06:47.138019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.140689Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.140689Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:c7b6745044ce33ea4d8081130898963b34ed4c58795cf1ae9eb9d4763b2ae3ad","observation_id":"1d1d480b-0a22-441f-aa25-ea85dadb1998","resolution":{"observed_at":"2026-08-07T11:06:47.140689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.143079Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.143079Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:bfb339702796cf6a3297683099c5176b68b7f3f9ef72a13af2f7988f22f71d59","observation_id":"33643378-5330-478d-a773-1f9c2b16b9d0","resolution":{"observed_at":"2026-08-07T11:06:47.143079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.145501Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.145501Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:8ac788d9efd5eedea58b999570991e27273aa9585d521adfdb1f67425ff9e068","observation_id":"a2ee085e-fbe9-450c-be7f-b5d8a9abf6d4","resolution":{"observed_at":"2026-08-07T11:06:47.145501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.148291Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.148291Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:36959f48740e2eb68e01c2fed955aa02bb30d151719250b160ebdf11843fd595","observation_id":"bf87a4d4-dcd1-4d49-acd0-ecd616b9d388","resolution":{"observed_at":"2026-08-07T11:06:47.148291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.151140Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.151140Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:0812d20f2eec6bbad1ba7f8ed1034ecb9719d916431d8f4085da0f69cf189091","observation_id":"17d77ab9-9a57-4496-bd91-68f97ccc174a","resolution":{"observed_at":"2026-08-07T11:06:47.151140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.092319Z","title":null,"venue":null,"work_id":"49a28a1b-e7a0-4f85-90dc-0bf7f5c047b7","year":2020},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.153531Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:25f76e5294b8872ed7f14c08fa237d65ad39993fbc6cd8ebb18168a2f1ca5a3e","observation_id":"8af75f5c-76a2-4b5c-a589-556d99d69219","resolution":{"observed_at":"2026-08-07T11:06:48.095169Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.083889Z","title":"Pedersoli, T","venue":null,"work_id":"9aaa01da-4d3c-423c-b2ed-e05819a2be2f","year":2017},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.155899Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:286ad451f6cedcc29289d2aae397cf45468664dedb7951b8caf79e3bafcfeadb","observation_id":"49e53569-3579-4230-9e6d-bd20ba2f5fde","resolution":{"observed_at":"2026-08-07T11:06:48.086897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.074998Z","title":"Jindal, A deep learning approach for arabic caption generation us- ing roots-words, in: Thirty-First AAAI Conference on Artificial Intelli- gence, 2017, pp","venue":null,"work_id":"03063cb3-0db8-48dc-ab96-ae5b49115160","year":2017},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.158247Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:b76e395b8f96802e6e33c57f13d2f6fb9656450fac8767be6f497264a66b5da7","observation_id":"4ba1d14a-aff0-4d40-98f6-498ab791252f","resolution":{"observed_at":"2026-08-07T11:06:48.078133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.066806Z","title":null,"venue":null,"work_id":"4674862e-395e-4705-8f8a-e095b4d19047","year":2018},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.160518Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:9ba9df8b3d9d89ce3e81d00bbd15e8da05b3284bed94e610101b6dda242a1b5a","observation_id":"1358b1c9-df00-4236-8a8f-0fd57f6e9b17","resolution":{"observed_at":"2026-08-07T11:06:48.069681Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.057778Z","title":null,"venue":null,"work_id":"233e88ce-2848-45a0-8743-bd2a80edb8ea","year":2018},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.163083Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:c6f1952db4b78b2367716846e6ac3b733e5f4e1a8b7a36d0c3b5528bab7ec923","observation_id":"a392011c-5b0a-4618-8c37-59bd916facec","resolution":{"observed_at":"2026-08-07T11:06:48.060907Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.049722Z","title":"Mualla, J","venue":null,"work_id":"c63c6adb-b2d1-422d-b520-1e0b45fad9fb","year":2018},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.165918Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:ded513a586b6003134398b21a86f4145b026af5345a45a4997138ce216b4fc00","observation_id":"50934265-f420-4fad-a7b1-ad0c62be93fb","resolution":{"observed_at":"2026-08-07T11:06:48.052547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.040904Z","title":"ElJundi, M","venue":null,"work_id":"898ad2b1-57de-4135-a713-744e2763800d","year":2020},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.168445Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:70831ef87313510208da903c7606238e86bd5694f5554761b6a260da838e078f","observation_id":"942369a7-b82f-4a23-8581-22ff3f6ae35a","resolution":{"observed_at":"2026-08-07T11:06:48.044093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.030859Z","title":"Hejazi, K","venue":null,"work_id":"62667dee-7296-43b3-b159-f00db4ae7100","year":2021},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.171059Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:9eeaac7fb7bfaa23fb7fe8e0fd42d5e022cf07cc803dcbf53c17aca525c24082","observation_id":"980a08b0-ac06-4488-bbdb-55af0b462c18","resolution":{"observed_at":"2026-08-07T11:06:48.033868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.022022Z","title":null,"venue":null,"work_id":"c8b8979d-94c7-4d4b-92f6-2a376a2fd6c0","year":2021},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.173481Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:d8f535c030ae278bcebd7dfb1151c7281fea0af8e9f32135eab9c0ce4ed6a849","observation_id":"5c706573-3af2-4805-b51b-c6d65ac7ab48","resolution":{"observed_at":"2026-08-07T11:06:48.025015Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.013306Z","title":"Emami, P","venue":null,"work_id":"db6fc5c7-7d6a-4715-9d82-d38995c9d9b5","year":2022},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.175772Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:a6517b91ed181e84898ec25d2d5de55e530cf5c2de4823446ae826946b1a941c","observation_id":"0e053596-c486-43a4-a3b2-d24932ab8ca4","resolution":{"observed_at":"2026-08-07T11:06:48.016449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:48.004398Z","title":null,"venue":null,"work_id":"a390e656-e58e-4766-bdb7-2a420b1b34dc","year":2022},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.178230Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:db9f60053caf6dbe41a44a9b706bed246d6b6780340d1950d12d46da77a0c2ea","observation_id":"6917ceab-bbeb-48af-b992-d345210bedef","resolution":{"observed_at":"2026-08-07T11:06:48.007718Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.995926Z","title":"Alsayed, T","venue":null,"work_id":"382ab724-12fc-4de0-9fbe-faabb3bee9ff","year":2023},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.180673Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:bea57f7dafe7b46a3a32ff3241cdaf591b8ac6a8b0902bf4f86eced6fbf3f9e4","observation_id":"8f9da3b2-ffdc-481e-b678-b88b93aba677","resolution":{"observed_at":"2026-08-07T11:06:47.998860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.183748Z","title":"Elbedwehy, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.183748Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:c74d204028cd144fc8e32a661a9c7b45232034ea291a3a28acbcbc8a15b53cd7","observation_id":"a57bea6d-cd9e-44d9-9ec7-70ac6f7f1bc1","resolution":{"observed_at":"2026-08-07T11:06:47.183748Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.186163Z","title":"Karpathy, L","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.186163Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:5fff2184a5928a17dfee7278986f578ace10086eb33318451745c2faf3adeca6","observation_id":"325707c7-9603-44f7-b6dd-2a216f2ec4e0","resolution":{"observed_at":"2026-08-07T11:06:47.186163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.982418Z","title":null,"venue":null,"work_id":"b2571d7c-1658-424d-82cf-e26bfc6cca26","year":2021},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.188500Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:af08f15b87b0edd27c056f58be6ab7a63a359c08de7b048bc37002f0bf2f5857","observation_id":"56ed3bef-87d3-4fc9-a2a0-36ed51a49a44","resolution":{"observed_at":"2026-08-07T11:06:47.985402Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.974214Z","title":null,"venue":null,"work_id":"3eb6f8bd-5937-4094-afd4-68ec4f155a4d","year":2023},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.191009Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:d669d792d1ae3ba17aaf37e40f5c8ecb39a7760cd4782b7324e3f831024ebe34","observation_id":"20064f0f-ab0b-4e75-a4ec-7186954878e2","resolution":{"observed_at":"2026-08-07T11:06:47.977192Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.965307Z","title":"Jiang, Z","venue":null,"work_id":"65e8f73a-1edd-4754-b374-3e03c7f5ec16","year":2019},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.193623Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:4b00824ed963e05dc689f1eb6353d63c0582394b1354c16db743727894144863","observation_id":"b759e2fb-fa7c-46d3-aa84-2a3df24ef024","resolution":{"observed_at":"2026-08-07T11:06:47.968156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.956990Z","title":"do Carmo Nogueira, C","venue":null,"work_id":"500db932-75c9-4290-9cea-ba330e890b78","year":2020},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.196295Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:7f7d9f8b5dcb60ff4f4be555a8071c156cd0b5cccfc20d0eede20e81cdc1a0f3","observation_id":"1cb2237c-d618-496b-9c43-969fcc029ac9","resolution":{"observed_at":"2026-08-07T11:06:47.959762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.948910Z","title":null,"venue":null,"work_id":"c18469fa-d3e1-4da3-8a43-4d566abeb889","year":2017},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.198805Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:aef04cf0e4aecf4fb1d94c67e96208a978cfbe055c466c7aa8da73eb0248dcae","observation_id":"2c374abd-3cfd-4776-9285-fac25219c442","resolution":{"observed_at":"2026-08-07T11:06:47.951701Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.940568Z","title":"Kalimuthu, A","venue":null,"work_id":"b4c7e587-d809-48e4-b798-aa86a891ebdd","year":2021},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.201678Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:1ec1a46e957550e516047c87b018dc88c37b3d5f7e3423d4bbd642246cbba9b9","observation_id":"6aa657e4-23cb-4934-a11c-4366b378ff3f","resolution":{"observed_at":"2026-08-07T11:06:47.943489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.932561Z","title":"Abdussalam, Z","venue":null,"work_id":"2d4041aa-f355-4a56-9f18-12adda39c0a8","year":2023},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.204265Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:efa12edd923285b7e6f859d6848ce848ae5960c9adeeeb5801b7e77294f3498c","observation_id":"369dc503-b762-49ce-852c-b6b5387179ac","resolution":{"observed_at":"2026-08-07T11:06:47.935473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.924432Z","title":"Shrimal, T","venue":null,"work_id":"e5533f5f-508f-41e4-9c6f-e66511a09d29","year":2021},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.206755Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:f9629b36d9a07aee771d62f424b9947444d658f78baaba7cc92a9e22cc459ac3","observation_id":"2e1eb804-a35f-41e6-a577-bdf8b2a4c08a","resolution":{"observed_at":"2026-08-07T11:06:47.927435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.916313Z","title":null,"venue":null,"work_id":"db7e5cc9-5f98-4f36-bba1-e689625c8d03","year":2020},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.209307Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:606310628ad14ca895667b71e175a6898bdf996fae28115779747aa5499291a3","observation_id":"9e396c3d-d64e-4abb-be8c-b9773c951fa7","resolution":{"observed_at":"2026-08-07T11:06:47.919230Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.900382Z","title":null,"venue":null,"work_id":"366e6a9c-86df-41e6-ac48-ef9f86e6afb4","year":2021},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.214314Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:f46f1df1357000f04e15ba8b690c959b6f1bfb3a39e8e9fae151448970b02f15","observation_id":"c0dd4fd0-5177-45ef-b656-df4d812529f6","resolution":{"observed_at":"2026-08-07T11:06:47.903206Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.891615Z","title":"Fei, Attention-aligned transformer for image captioning, in: Proceed- ings of the AAAI Conference on Artificial Intelligence, V ol","venue":null,"work_id":"2ebb513a-b80c-4bdc-9168-01e897660ea6","year":2022},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.216740Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:e8f75b299ce08430967f5b50192c04e32b92909d03f470f346c8f2b7c014206f","observation_id":"9a280eab-a362-4eca-be9d-3712ea8ab3c6","resolution":{"observed_at":"2026-08-07T11:06:47.895204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.883573Z","title":null,"venue":null,"work_id":"03f6dc3f-9efe-49f2-89d3-774e10ab0c0e","year":2022},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.219434Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:f379189d007d5f2b54180855a801b26e202faa622e6c3d43864ca4c7e1881db3","observation_id":"2e98720f-bbf6-4c45-8102-11d0e3f5cfcd","resolution":{"observed_at":"2026-08-07T11:06:47.886370Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.875683Z","title":null,"venue":null,"work_id":"439fab99-b311-49eb-a7c5-4d87822e3dd2","year":2022},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.221819Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:7dc5dd1701cb6571e48f069da5fa23f8d51aec08ba4000bec1c8c11321bf9359","observation_id":"2592651e-2f96-4f58-a035-0ac6e34cb731","resolution":{"observed_at":"2026-08-07T11:06:47.878366Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.867799Z","title":"Mulyawan, A","venue":null,"work_id":"4a2ab0be-d2e1-4f7f-b703-feacbefd6845","year":2022},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.224212Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:bce61225bbcf35a08631063a8f1855b210e4da2795241484758dfe60a8ca922d","observation_id":"722d9f8c-b2e8-4c8e-a553-7ecba1180280","resolution":{"observed_at":"2026-08-07T11:06:47.870598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.859770Z","title":"Mulyanto, E","venue":null,"work_id":"1a3b2bd8-d9e8-4a31-b7ee-7b74af19f215","year":2019},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.226494Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:6e254c0c8b4f1e4adc9a4b3a855237c5f3c874de1b539ed87957245c8c19f59c","observation_id":"294c6653-c93f-4ac9-9a64-704755e6f1a6","resolution":{"observed_at":"2026-08-07T11:06:47.862592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.851886Z","title":null,"venue":null,"work_id":"0b7bc830-6b01-44dc-9d80-993ef1b5efc7","year":2024},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.228904Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:e4ec618e5343b5b0cc58dd1ca8c37ce2a049268fde9aed83a99757b87035d54f","observation_id":"ece42c45-8237-42e6-a1dc-07f598a7305f","resolution":{"observed_at":"2026-08-07T11:06:47.854721Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.844196Z","title":null,"venue":null,"work_id":"1efdf746-88dd-4ea8-a13b-f70a348488a2","year":2019},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.231565Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:a4d513656016f1aa28da4425f1a62db046dce9cbd3963fd115262c7403118e22","observation_id":"937b0dc7-1c64-42fb-9dcc-b95ded7e07a8","resolution":{"observed_at":"2026-08-07T11:06:47.846931Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.836281Z","title":null,"venue":null,"work_id":"31ee11b4-1c26-49e2-a487-0eaf921e8803","year":2020},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.234162Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:827cd513fdb83de877a7980cc3c94fc062846277463c6991ed897bd2a7e5cd43","observation_id":"db76c48f-64bd-478c-b74a-ca50524db3aa","resolution":{"observed_at":"2026-08-07T11:06:47.839099Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.828097Z","title":null,"venue":null,"work_id":"e1aa92ca-f5fa-4223-b995-84d091b2de4f","year":2023},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.236524Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:74f62384bc21b2c24b73517a8427780698f14f6821c24d660c1793384bfe7333","observation_id":"2e89f844-f1c9-4b3f-8969-3ebdc37d29f4","resolution":{"observed_at":"2026-08-07T11:06:47.830860Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.819440Z","title":"Muhammad Shah, M","venue":null,"work_id":"533f922e-b059-43e1-9f27-cdb87b59fd7a","year":2022},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.239124Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:afe78e97b574ad08d94d1a16b670e3a6a023d9abf65dbb4a27907189706c1ce9","observation_id":"d4f2c0ba-aabd-4d24-8756-251fa1382bc1","resolution":{"observed_at":"2026-08-07T11:06:47.822160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.811652Z","title":null,"venue":null,"work_id":"fb7fe15e-8336-467b-9861-ea450feddca9","year":2021},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.241901Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:cc9d2aea2923a911960e9c18cd89aaee07250a9441b507255ea5e7f4619bfc8d","observation_id":"a8d456c9-5d80-4ee8-a658-4643e3ff52d1","resolution":{"observed_at":"2026-08-07T11:06:47.814243Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.803054Z","title":"Humaira, P","venue":null,"work_id":"81baafb5-eaf3-44de-80cc-8c2a32f2ff37","year":2021},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.244223Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:a577605d76c3ecfb4607174896f95c9f2e34dc31d2ff98d226493ef751c1bbe3","observation_id":"872e2749-6ae4-426b-800a-69e42e253353","resolution":{"observed_at":"2026-08-07T11:06:47.806404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.794992Z","title":"Kulkarni, V","venue":null,"work_id":"40764caf-40e1-4c08-8d53-b5d5b50cd004","year":2013},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.246692Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:2cce4ea869efca48fe3240aa7ca7718b5d86735df61e48be0a0e97c781967732","observation_id":"a32a6feb-c447-4977-9b4f-1bb249522e60","resolution":{"observed_at":"2026-08-07T11:06:47.797803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.787329Z","title":"Kpalma, J","venue":null,"work_id":"1e8792c7-265a-410d-9731-b4ffb3700e26","year":2007},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.249036Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:c4ae9d06dd7ba783387a789415bcc017a3e4789effe83b9d2adc342e352e176c","observation_id":"1735eaaa-d5bc-429c-8314-172bd21b853d","resolution":{"observed_at":"2026-08-07T11:06:47.789888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.779174Z","title":"Sezgin, B","venue":null,"work_id":"3bb9b2f7-632d-476f-aac4-98f5c879583e","year":2004},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.251658Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:bc7ae68372026431fe06f17ec6f6fb33a06434e2f2ca86bd8347e8bf53c61df3","observation_id":"ad02d7eb-297d-4631-8f37-9140cd417dc9","resolution":{"observed_at":"2026-08-07T11:06:47.781786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.771199Z","title":"Almanaseer, M","venue":null,"work_id":"e3cb6856-f7aa-4c88-a022-31b1b4e18946","year":2021},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.254015Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:26f01a6f50968eb9e841e0e03c71585d5b0f038d75f07c1e1cf0d3c2817d44d3","observation_id":"f84d108f-58aa-4e13-80a8-98ed0f3d1c4b","resolution":{"observed_at":"2026-08-07T11:06:47.773709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.763758Z","title":null,"venue":null,"work_id":"09bae4e7-bbfd-4665-ac47-3a295c842b50","year":2019},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.256432Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:459072443cd1333cabc5c7e25bef778b9aed9979f4f5ab2b419db5a2cd6eb0c2","observation_id":"8e8560d6-9df8-4245-bf40-7420b95c98b8","resolution":{"observed_at":"2026-08-07T11:06:47.766337Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.755791Z","title":"Zakraoui, S","venue":null,"work_id":"60060e54-16a6-4682-bf7a-ba35e79f0476","year":2019},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.258856Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:1b94bcc11216d36f12ce16df25dcb729b71479ab4eef4f91294af5bfe40a2a21","observation_id":"25f56448-baa9-4511-9cb1-9a6079d25eab","resolution":{"observed_at":"2026-08-07T11:06:47.758872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.748206Z","title":"Saleh, J","venue":null,"work_id":"d1040db6-97cb-44d5-aae5-e5c88c94aabc","year":2019},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.261116Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:72bcf847d5b276377f3e32357ed686607336c68f209e8558d29a23c55709535e","observation_id":"4e6cb356-c27d-4007-b2b7-ad6e5226a2eb","resolution":{"observed_at":"2026-08-07T11:06:47.750549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.740817Z","title":"Alzubaidi, J","venue":null,"work_id":"883f6cfd-519c-4294-beb8-6fc3ab82969b","year":2021},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.263956Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:84acb843966efb09262ed33619e040625642f060431bd7578230ffaf65d51510","observation_id":"b4e31547-abbd-407c-a1dd-76e4f70b7cc4","resolution":{"observed_at":"2026-08-07T11:06:47.743319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.732344Z","title":"Zhang, W","venue":null,"work_id":"c5346986-d11f-4386-be1f-fd9e9d4d7054","year":2019},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.266340Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:62942d05649c32b9107fd5c3c119b04ab1054d962699c152a278a6c1d1bdd781","observation_id":"23646460-2603-4257-8bad-eb2b54864b9e","resolution":{"observed_at":"2026-08-07T11:06:47.735532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.724908Z","title":null,"venue":null,"work_id":"2c9315d5-29c7-44f4-845b-e6b46d816c30","year":2020},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.268965Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:dfed004ef24d64f8162863c79f5a351052f9a8279289164550da3d3c39d23f8e","observation_id":"ca983257-e02b-4e90-bc07-ed2e5792d111","resolution":{"observed_at":"2026-08-07T11:06:47.727314Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.717314Z","title":"Kumar, V","venue":null,"work_id":"f5d1ff81-7116-45a8-8a63-382de9fe3af9","year":2022},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.271899Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:c084db58752cbc502540ccb19ad5cf50dafbe09a49f62b0124686843d5b65ede","observation_id":"9d4b3c97-339e-41bc-a8d6-d13bc2132468","resolution":{"observed_at":"2026-08-07T11:06:47.719824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.708907Z","title":"Nguyen, M","venue":null,"work_id":"3dab2210-7514-4501-a545-1b7e5d6a0a28","year":2022},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.274175Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:e26e8849ea46932b22ee2c803deac66c4674e55948d59d8473e56e5d61d2421e","observation_id":"cb3a51e6-411a-4dd5-a2d7-bda31f61b723","resolution":{"observed_at":"2026-08-07T11:06:47.711855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:06:47.908574Z","title":null,"venue":null,"work_id":"bb998032-3c29-4f38-aa3e-ad0f44fc6f00","year":2022},"citing_paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T11:06:47.276588Z"},"links":{"citing_paper":"/paper/2506.05399"},"observation_digest":"sha256:2b31608d2a461f7d63ca1c211f80e3590f44b0bd54d3087c7c3ac400e841a454","observation_id":"b0001fca-4542-4d31-9972-b5481e43ef08","resolution":{"observed_at":"2026-08-07T11:06:47.911259Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05399","last_updated":"2025-06-03T22:18:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T21:50:12.809766Z","submitted_at":"2025-06-03T22:18:19Z","title":"Attention-based transformer models for image captioning across languages: An in-depth survey and evaluation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":71,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":130},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 130 outbound references and 0 inbound Pith citation observations for arXiv:2506.05399."}