{"as_of":"2026-08-08T03:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e66094c10b72083480d1df676b1b623ebd4306aa5168b8240ebf08816875b6ba","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:52:46.278075Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.23358/citation-record","integrity":"/paper/2505.23358/integrity","json":"/paper/2505.23358/citation-record.json","paper":"/paper/2505.23358"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:38.225153Z","title":"Anderson, X","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.225153Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:4bbfe305e041e14d939fde4b5c8a171fd3f1e0896749761825e518c7b9aa119a","observation_id":"e70c888e-fa71-4752-9764-9110e71fe033","resolution":{"observed_at":"2026-08-07T12:52:38.225153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:58.551083Z","title":"Cornia, M","venue":null,"work_id":"a9202c44-8f76-42d2-9b16-f3835ac6b4b4","year":2020},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.329252Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:37605d08b045fc3164bce78b3c1452b501f95383753cfe706f56a5435d69291c","observation_id":"4888885c-d95a-475b-9753-6f939a93b7e2","resolution":{"observed_at":"2026-08-07T12:52:58.633849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:58.279098Z","title":"Vinyals, A","venue":null,"work_id":"e3e8a84a-12bf-41c2-8a9f-1e01f1322a83","year":2015},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.400669Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:19d81bd80adc5851cea04b26916f2206d1844ef04874d4458615f4229e77cc16","observation_id":"1e9e79fd-4936-415a-bfc2-6d29ce0e0484","resolution":{"observed_at":"2026-08-07T12:52:58.403872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:57.889400Z","title":null,"venue":null,"work_id":"770fd15f-880a-4aa9-a892-fb36293096ed","year":2024},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.489602Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:71e80a6407f3abe8d99ecbe3ec88c0b02c9c30415ad2e57c127fff4791cd0e5b","observation_id":"e7a65481-e849-446c-9b33-c414de9c311c","resolution":{"observed_at":"2026-08-07T12:52:58.054236Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:57.538175Z","title":null,"venue":null,"work_id":"0a62a0e7-644f-4091-a803-af1b4b010af5","year":2024},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.569375Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:41d17b63379b967eda912673542f6889cbc6a8caf38789ac10b2128dbe1346e1","observation_id":"f9435839-2957-4c63-9835-47d5448e576c","resolution":{"observed_at":"2026-08-07T12:52:57.704900Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:57.238073Z","title":"Stefanini, M","venue":null,"work_id":"0c910307-8e59-44f9-a7aa-2ed961990d7e","year":2022},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.647327Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:36ee5576b1b176af5233966ee55370dd35cb054ce255f2bc25a05c84c640730b","observation_id":"f6af9ec9-d65a-4cc5-a68e-deaa09cf7908","resolution":{"observed_at":"2026-08-07T12:52:57.397582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.24963/ijcai.2023/697","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:46.753356Z","title":null,"venue":null,"work_id":"b2ed5b90-0a51-4036-b17a-956ddf160b78","year":2023},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.727922Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:d12eba8924c16acec4917b7562361e6832f19133ccaaca52107446ee85b2e513","observation_id":"fef9e153-5601-4eaf-968a-29db34242249","resolution":{"observed_at":"2026-08-07T12:52:46.868814Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.08106","last_updated":"2021-05-17T18:35:24Z","snapshot_observed_at":"2026-08-04T07:02:06.418166Z","submitted_at":"2021-05-17T18:35:24Z","title":"Multi-Modal Image Captioning for the Visually Impaired","version":1},"cited_work":{"arxiv_id":"2105.08106","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.08106","snapshot_observed_at":"2026-08-07T12:52:48.847429Z","title":"Multi-Modal Image Captioning for the Visually Impaired","venue":"cs.CL","work_id":"20488bcb-0b7d-42bb-861b-72e085f8ecfc","year":2021},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.796139Z"},"links":{"cited_paper":"/paper/2105.08106","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:0ef554ebfd3308b15e2de11235322bd0d4ccb1e336e2cd310637f28564817926","observation_id":"785ad6f3-02cf-40b6-ae2b-bfaed1889868","resolution":{"observed_at":"2026-08-07T12:52:48.959440Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.11696","last_updated":"2021-06-19T00:16:56Z","snapshot_observed_at":"2026-07-06T10:26:41.869841Z","submitted_at":"2020-12-21T21:48:18Z","title":"Image Captioning as an Assistive Technology: Lessons Learned from VizWiz 2020 Challenge","version":2},"cited_work":{"arxiv_id":"2012.11696","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.11696","snapshot_observed_at":"2026-08-07T12:52:48.634903Z","title":"Image Captioning as an Assistive Technology: Lessons Learned from VizWiz 2020 Challenge","venue":"cs.CV","work_id":"eff2928f-4394-4c58-ba2d-7490087206dc","year":2020},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.871685Z"},"links":{"cited_paper":"/paper/2012.11696","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:1c02be3dda077b76ef5526893075967979da01fb848f94efecd5772d8bdb9078","observation_id":"029b2ba3-8538-4874-a84c-66bbcea5383d","resolution":{"observed_at":"2026-08-07T12:52:48.712342Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08565","last_updated":"2020-07-15T15:48:35Z","snapshot_observed_at":"2026-07-06T08:58:39.542748Z","submitted_at":"2020-02-20T04:36:39Z","title":"Captioning Images Taken by People Who Are Blind","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08565","snapshot_observed_at":"2026-08-07T12:52:38.976502Z","title":"Gurari, Y","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.976502Z"},"links":{"cited_paper":"/paper/2002.08565","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:1136afc08ae662e5474198f7a79205d36f665d7e75c5b1c74c9bf6c0f5d50f99","observation_id":"75d3e471-50d6-41aa-b64f-e410ff65e797","resolution":{"observed_at":"2026-08-07T12:52:38.976502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.11591/ijai.v12.i3.pp1104-1117","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:46.474484Z","title":"Faurina, A","venue":null,"work_id":"e35d4f9c-1143-4432-8718-b2faf7e623b5","year":2023},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.078368Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:98f16fce0cec1ae8d2370020ca6bd8d9024b3ed321b799ebbbb1850b5df8615d","observation_id":"f159e2fb-340f-4bf6-957e-dfbea85de435","resolution":{"observed_at":"2026-08-07T12:52:46.561064Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:56.933025Z","title":null,"venue":null,"work_id":"62cbc0f6-8ecd-40c1-bb1e-847df208da68","year":2023},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.151464Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:c647a5174764e4de0c4828891266db4017915c612438602d376ede0917500b0e","observation_id":"ac40d6e8-8e45-4d00-b667-8e002468660b","resolution":{"observed_at":"2026-08-07T12:52:57.078394Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:56.655964Z","title":"Nikiforova, T","venue":null,"work_id":"f97ae557-ea87-4d7f-8892-57062d55b727","year":2020},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.232914Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:ff891f28f293cda6add49b1efa47c852f42fb3b86c6bae64d7057e79d762fb76","observation_id":"be2580ea-5407-4093-a27d-0affbbdd62ab","resolution":{"observed_at":"2026-08-07T12:52:56.773631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08876","last_updated":"2019-06-20T21:51:48Z","snapshot_observed_at":"2026-07-06T08:01:50.383586Z","submitted_at":"2019-06-20T21:51:48Z","title":"Informative Image Captioning with External Sources of Information","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08876","snapshot_observed_at":"2026-08-07T12:52:39.321919Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.321919Z"},"links":{"cited_paper":"/paper/1906.08876","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:1ed022e50dc417966c33bad1879eeffd69ab4c29fbaf70274ca321b2e168d38a","observation_id":"dd4c3f21-c962-4f7f-b8a0-c02c1272136c","resolution":{"observed_at":"2026-08-07T12:52:39.321919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14499","last_updated":"2022-03-28T04:59:16Z","snapshot_observed_at":"2026-08-06T14:37:23.609927Z","submitted_at":"2022-03-28T04:59:16Z","title":"NOC-REK: Novel Object Captioning with Retrieved Vocabulary from External Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14499","snapshot_observed_at":"2026-08-07T12:52:39.390400Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.390400Z"},"links":{"cited_paper":"/paper/2203.14499","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:2f57d33d716b746905018660ffcf2b90eb2f40bd311338f18e3a69d63c58f364","observation_id":"5d799102-8f3a-42d4-bca7-8b91f9706c54","resolution":{"observed_at":"2026-08-07T12:52:39.390400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.11970","last_updated":"2021-07-26T05:50:41Z","snapshot_observed_at":"2026-07-06T11:32:23.938810Z","submitted_at":"2021-07-26T05:50:41Z","title":"Boosting Entity-aware Image Captioning with Multi-modal Knowledge Graph","version":1},"cited_work":{"arxiv_id":"2107.11970","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.11970","snapshot_observed_at":"2026-08-07T12:52:48.384177Z","title":"Boosting Entity-aware Image Captioning with Multi-modal Knowledge Graph","venue":"cs.CV","work_id":"67c510dd-5459-4014-a4f3-f7ff91e53af3","year":2021},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.476170Z"},"links":{"cited_paper":"/paper/2107.11970","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:bff4123ad170afac4df78dbae374f3cf7a7d83ca0b53b31d72f0ef33f511120f","observation_id":"5fd0f2c5-6556-4c46-9c11-51f0167ff03a","resolution":{"observed_at":"2026-08-07T12:52:48.458488Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07889","last_updated":"2018-11-07T04:12:38Z","snapshot_observed_at":"2026-07-06T06:34:39.068244Z","submitted_at":"2018-04-21T04:40:10Z","title":"Entity-aware Image Caption Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07889","snapshot_observed_at":"2026-08-07T12:52:39.553652Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.553652Z"},"links":{"cited_paper":"/paper/1804.07889","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:611875da367b77090d165c5aaa71ca1bea068e07a344dfdae2e8af3cb470b12f","observation_id":"60d63913-eb1e-4af9-abd2-d5caaf9684ea","resolution":{"observed_at":"2026-08-07T12:52:39.553652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15879","last_updated":"2024-04-07T14:43:38Z","snapshot_observed_at":"2026-07-06T16:53:05.949503Z","submitted_at":"2023-11-27T14:51:37Z","title":"EVCap: Retrieval-Augmented Image Captioning with External Visual-Name Memory for Open-World Comprehension","version":2},"cited_work":{"arxiv_id":"2311.15879","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.15879","snapshot_observed_at":"2026-08-07T12:52:48.118883Z","title":"EVCap: Retrieval-Augmented Image Captioning with External Visual-Name Memory for Open-World Comprehension","venue":"cs.CV","work_id":"548be183-e5e7-4b43-8111-76f5cb9e5bae","year":2023},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.641589Z"},"links":{"cited_paper":"/paper/2311.15879","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:1192d834c481ce58f126fbcc099195359490d7e200408ac6b13febafdedb4af4","observation_id":"bbb191e8-7261-4676-8baf-c2bd74b465ac","resolution":{"observed_at":"2026-08-07T12:52:48.254957Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:56.349977Z","title":null,"venue":null,"work_id":"52d40e88-3100-4d12-9d94-c94305cdf749","year":2023},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.752067Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:62c14db805ba82f7ca34590c7777f19717f2273e08f7cd00b5584ba4ab469c49","observation_id":"87ec3b0d-016b-4d07-a39a-87c165e74893","resolution":{"observed_at":"2026-08-07T12:52:56.473669Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:56.067098Z","title":"Zhang, X","venue":null,"work_id":"9d16317f-7f1e-42a3-9a34-0b210dc9b1bf","year":2023},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.866012Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:b248c5247183a55647f51939a485f57e1111b1245cdca69c06fb5fdfb61a5dc4","observation_id":"0b82bc37-5fdc-46fd-8889-aa1c7f230e41","resolution":{"observed_at":"2026-08-07T12:52:56.216551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:55.734758Z","title":"Ayesha, J","venue":null,"work_id":"03b40c57-acc7-41b3-adb1-d7fd47fdf1d7","year":2022},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.022083Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:151630c4c8caa84912c12c17f7f459a72e29596ae0a3f0828268e97a6c6e860c","observation_id":"903d26c9-c6ec-40ce-8b66-e5489d9accc2","resolution":{"observed_at":"2026-08-07T12:52:55.875785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.08389","last_updated":"2018-05-22T04:41:37Z","snapshot_observed_at":"2026-07-06T06:40:27.094331Z","submitted_at":"2018-05-22T04:41:37Z","title":"Joint Image Captioning and Question Answering","version":1},"cited_work":{"arxiv_id":"1805.08389","doi":null,"metadata_source":"pith","pith_arxiv_id":"1805.08389","snapshot_observed_at":"2026-08-07T12:52:47.982764Z","title":"Joint Image Captioning and Question Answering","venue":"cs.CL","work_id":"fe468388-2462-46db-9ae4-e4830dda3e55","year":2018},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.177749Z"},"links":{"cited_paper":"/paper/1805.08389","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:0c62807bb1d3684d9aa2128be5aa009c64bf0316a85fe91c266a1734a0651444","observation_id":"f931b5b8-6cc6-44b8-9613-0f4090991634","resolution":{"observed_at":"2026-08-07T12:52:48.040856Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:55.484587Z","title":null,"venue":null,"work_id":"4bcfafbf-cbbf-43b1-8880-e1cdc035fb92","year":2019},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.237589Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:3f02a42412556841d5808a2f9da110f5338e0ea08c2b30cbed3946c1f7834dcf","observation_id":"554effaf-be40-4e95-9c68-f3535c39c000","resolution":{"observed_at":"2026-08-07T12:52:55.602175Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:55.175640Z","title":"Salaberria, G","venue":null,"work_id":"e8a0594c-c671-40cc-9352-3c183c8a39d9","year":2023},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.385666Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:0239e6b93536bb5f62deabdb2180a472cb724f8076386b8694ddce327f82a941","observation_id":"54812251-928e-4475-90ea-ce0238a75fe7","resolution":{"observed_at":"2026-08-07T12:52:55.352987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08589","last_updated":"2024-04-12T16:35:23Z","snapshot_observed_at":"2026-07-06T17:59:25.200363Z","submitted_at":"2024-04-12T16:35:23Z","title":"Enhancing Visual Question Answering through Question-Driven Image Captions as Prompts","version":1},"cited_work":{"arxiv_id":"2404.08589","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.08589","snapshot_observed_at":"2026-08-07T12:52:47.762048Z","title":"Enhancing Visual Question Answering through Question-Driven Image Captions as Prompts","venue":"cs.CV","work_id":"85daa49a-7bd7-4517-b6ce-d1ab80f51470","year":2024},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.470416Z"},"links":{"cited_paper":"/paper/2404.08589","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:bf01228f9887b4ec7eb0668ca09fde3f77eef5131f4be8cc8a50d28655d54434","observation_id":"7c0678fa-8fff-4c8a-b8d4-380ad916ee57","resolution":{"observed_at":"2026-08-07T12:52:47.869346Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1603.02814","last_updated":"2016-12-16T11:44:34Z","snapshot_observed_at":"2026-07-06T04:48:52.708353Z","submitted_at":"2016-03-09T08:56:45Z","title":"Image Captioning and Visual Question Answering Based on Attributes and External Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.02814","snapshot_observed_at":"2026-08-07T12:52:40.597487Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.597487Z"},"links":{"cited_paper":"/paper/1603.02814","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:c0c91af30b192ba6f6ff0a8675df257c2444d1aba08097414b9052a9f944d0e3","observation_id":"62d4644b-8acb-453a-ba90-f045a5abbfc8","resolution":{"observed_at":"2026-08-07T12:52:40.597487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:54.862175Z","title":null,"venue":null,"work_id":"60026604-fde4-492d-8b9a-a568d98d21ab","year":2016},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.746781Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:a405851ddc00e3627252653139115ded65bcfae0dd7fd232ebed52bb3d330577","observation_id":"5c33a43f-692b-48c9-a3a5-187a92206d95","resolution":{"observed_at":"2026-08-07T12:52:55.015213Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:54.632901Z","title":"Whitehead, H","venue":null,"work_id":"da349813-7ff9-465a-a7a2-2470ad7f08b0","year":2018},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.912671Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:53871d1d9958a04c0dc02b65bc2b0f40965bf423020b7bf366fe3948f6a373cf","observation_id":"bdc05ffb-3341-4d4f-a6b6-b089287f8993","resolution":{"observed_at":"2026-08-07T12:52:54.736213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:54.454137Z","title":null,"venue":null,"work_id":"3e8f0b6e-9e4a-4e69-8272-6352203cc69f","year":2020},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.044280Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:965f0490a3d726cb21344597f849bf6de04f29651c9e226bec0d635deb43bac3","observation_id":"f3755080-71f4-45c2-9779-3bd814c6b63d","resolution":{"observed_at":"2026-08-07T12:52:54.551892Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:54.287269Z","title":"Radford, J","venue":null,"work_id":"cbfef91e-a1fc-499f-bff1-30269475fa72","year":2021},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.156367Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:3493c7cd7598a85bd01ad2e33ce7c067258dc02af22c063f10c78db658223f37","observation_id":"785807f6-025b-422a-9fd9-ac259b927aaa","resolution":{"observed_at":"2026-08-07T12:52:54.357001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:54.024427Z","title":null,"venue":null,"work_id":"28f65b7b-cb87-40db-8e57-4275456aca5c","year":2022},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.242756Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:497479aff3214bed86cf95f059cc60f585cdd4118f652b1b56eef041cfbc4d1a","observation_id":"9ca17ee5-e151-4c6a-83e3-e9bf56c682a4","resolution":{"observed_at":"2026-08-07T12:52:54.188963Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:53.834488Z","title":null,"venue":null,"work_id":"7a2422c0-7a38-4b6e-a5b6-55c6c5cb779d","year":2022},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.347860Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:ba34f8cb1419595964028c5af44092fa68a8777aa4a97cf100798948f9461e8f","observation_id":"9bbf83b5-4d06-42c1-a951-73890c52ff38","resolution":{"observed_at":"2026-08-07T12:52:53.939757Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10904","last_updated":"2022-05-15T23:20:46Z","snapshot_observed_at":"2026-08-06T05:59:00.316195Z","submitted_at":"2021-08-24T18:14:00Z","title":"SimVLM: Simple Visual Language Model Pretraining with Weak Supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10904","snapshot_observed_at":"2026-08-07T12:52:41.477507Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.477507Z"},"links":{"cited_paper":"/paper/2108.10904","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:6143ba0d4b19658487cfc8f9832d95baf334b150964b6750fff6ab8db57d470b","observation_id":"77bd1637-6379-4ef3-8d25-928d3b36ff97","resolution":{"observed_at":"2026-08-07T12:52:41.477507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:53.592465Z","title":"Zhang, X","venue":null,"work_id":"e9f79e98-dddf-451a-b189-1d8e4d9889eb","year":2021},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.620139Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:be1f4b8fc79093b81471f09687d756202960e901579b04e164d0c15f97270f50","observation_id":"c5dbae6e-3d28-445d-a8a7-7d60e9ac6351","resolution":{"observed_at":"2026-08-07T12:52:53.718800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:41.737519Z","title":"Cheng, W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.737519Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:3a20481b56c385e3d35612510d793324486a301e6bf065301de757d5d3d1a201","observation_id":"e21a4c6f-2011-4bb3-83f2-fca4edc42986","resolution":{"observed_at":"2026-08-07T12:52:41.737519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:41.863756Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.863756Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:f36bc36d248e69df6d21a161d557c89ff29b703cecb6a8d5c6a45f6d2a9d5545","observation_id":"63038f23-68e0-4cf7-b811-4a6d07d8714b","resolution":{"observed_at":"2026-08-07T12:52:41.863756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.67890","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:47.253513Z","title":null,"venue":null,"work_id":"23ac2fe4-4a13-499e-9ac5-d44d53cb6a34","year":2025},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.935467Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:2a9eba88255f29a55f797d1adb86b52bdfe601ac34a909c6329e4c8ae36aa828","observation_id":"9bf901f3-42d4-4796-b3f9-57dca0f93082","resolution":{"observed_at":"2026-08-07T12:52:47.355468Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:42.077219Z","title":"Cheng, W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:42.077219Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:48c89f1aa57c004b84e07ba1c44e55beaf7c5bb796e6f496a4c1fd4c80084e82","observation_id":"aa067ddc-360f-49ec-ac90-0e63bab9460a","resolution":{"observed_at":"2026-08-07T12:52:42.077219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:53.430763Z","title":null,"venue":null,"work_id":"9dc29663-cd93-4399-99c1-d53fad109261","year":2020},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:42.260304Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:86b3b96a41a8f59b03ba8d8d31953cd5b79d6c6cdc01d698f8f67396517f4a33","observation_id":"e94ec38d-69ec-4738-a967-b5faadbeec74","resolution":{"observed_at":"2026-08-07T12:52:53.500630Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:53.186878Z","title":"Zhang, Z","venue":null,"work_id":"50003a46-1da8-438b-adbe-8dacf9e706b9","year":2023},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:42.414916Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:fcd55a57159c0f7b3686b67895e0eaf668b0ad315cbd2f28448ff44c202311da","observation_id":"bb68489d-5d11-41d8-9982-ea5f287d7e21","resolution":{"observed_at":"2026-08-07T12:52:53.308178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:53.021431Z","title":null,"venue":null,"work_id":"9032ffde-ed9b-4dad-9fb4-17a3a184ccd6","year":2021},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:42.564442Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:061011ad67f55db6e9e3e7bd047456370040bb62f8c4be1f95ab1f3faebd2d5f","observation_id":"317e716f-d6f1-4b0d-b7e0-5c577690f75f","resolution":{"observed_at":"2026-08-07T12:52:53.118429Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:52.813788Z","title":null,"venue":null,"work_id":"f49ef2c0-29ea-4079-b617-aac6f8d271f1","year":2022},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:42.746129Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:0d72cb3799dcd529b1594cf14f91d0f0cc2ebf97996f0b7106ca3c0ba5d22803","observation_id":"ead8fbd5-99c9-4163-9a60-66e4898bc5d6","resolution":{"observed_at":"2026-08-07T12:52:52.872374Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:52.615166Z","title":null,"venue":null,"work_id":"78db5161-b0d1-43ad-9963-68175525208e","year":2015},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:42.902878Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:53a2de2e8fc16f8426fcd9c74c0463757d3e593e643d3e2e8d57b4a61c846527","observation_id":"2ad7f8fa-a2e5-4653-9fc5-a25fb201a9c9","resolution":{"observed_at":"2026-08-07T12:52:52.726239Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:52.431665Z","title":"Huang, W","venue":null,"work_id":"7b9f733a-2575-4a56-a6cb-3140ce20414f","year":2019},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:43.080542Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:d65958e72e911ab7fa7db9b9b3f356304aaeec7e7dfc7d842ece4dba0e812b0b","observation_id":"a1497428-a809-49e1-ba46-d42f066e3c26","resolution":{"observed_at":"2026-08-07T12:52:52.516230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:43.291761Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:43.291761Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:db326f72cf8dc6ea3a574b8dcaef6ba24394584d92e1b0fadf5e94ba99c30323","observation_id":"7eb8d239-1849-4376-b212-2f30817b08e1","resolution":{"observed_at":"2026-08-07T12:52:43.291761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:52.218266Z","title":null,"venue":null,"work_id":"6e37d0d2-499b-4102-b32d-fd6cef997380","year":2015},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:43.376452Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:3c397da7f181162cac633ef09d97aa5a1b7ec7fd79faa3adfdbdc4044fb63ad3","observation_id":"939a91d4-e703-4647-8e57-dbec012f5be4","resolution":{"observed_at":"2026-08-07T12:52:52.328504Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:52.028436Z","title":"Devlin, M.-W","venue":null,"work_id":"5df9df54-83ce-4821-b389-0add07cee05a","year":2019},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:43.502994Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:65efc1328dbf14a1b2a8506c00867589ef706e4718e2d6445d872cedc87947b2","observation_id":"83882436-fe97-4f28-b95c-1947616b957c","resolution":{"observed_at":"2026-08-07T12:52:52.113059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:51.790812Z","title":null,"venue":null,"work_id":"e8ca05d2-adf0-4886-aa94-506d7c453445","year":2017},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:43.665941Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:64ae319d14d0d1d417aa9fe005f5a7c3a4ff84281c5afb9bbe8f26fbee2db67c","observation_id":"0c5efa97-c4d9-4a2a-a5ba-41674afba9bc","resolution":{"observed_at":"2026-08-07T12:52:51.880237Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:51.591152Z","title":null,"venue":null,"work_id":"cbdf97e3-3f9a-446e-a539-8fbbda4044b3","year":2017},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:43.799953Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:d161774f2215749e4ad97ecb982999cc6d59bd805a7a6b6b0d551f0c9269030a","observation_id":"68447c61-88fc-49cb-8413-4300f61ddb0a","resolution":{"observed_at":"2026-08-07T12:52:51.717387Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:51.397606Z","title":"Radford, J","venue":null,"work_id":"fcd2319a-0169-488c-baa3-cde54f89f3cb","year":2021},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:43.943310Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:a3b60fb0f9d465247551c8d80ac617675150b110671160163923a327db749a02","observation_id":"e97e983c-750b-499f-b0fe-c605f3f115da","resolution":{"observed_at":"2026-08-07T12:52:51.485927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-07T12:52:44.090056Z","title":"Mokady, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:44.090056Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:5f23caaba1af924e0e16e1b3742a389556e36919aacda0b6e945fbac112a3261","observation_id":"ab95742f-af91-4837-a8be-418c7492f131","resolution":{"observed_at":"2026-08-07T12:52:44.090056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:51.205491Z","title":null,"venue":null,"work_id":"d3f8d0ab-cccb-4370-b4fb-6dce82378cd2","year":2020},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:44.217497Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:ba0e5633d5fbdde789cc7dffbe2d2e81c0adce87ad78a4bb64a74ffba6252609","observation_id":"583f908b-8132-4b1d-a22e-58bdab4df765","resolution":{"observed_at":"2026-08-07T12:52:51.296324Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-04T09:31:34.784365Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14100","snapshot_observed_at":"2026-08-07T12:52:44.360480Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:44.360480Z"},"links":{"cited_paper":"/paper/2205.14100","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:9d7bf6fe3e94d537477297aa452f5fd4588ec9a38f65644c07fc04f061e53db5","observation_id":"d6987114-ce4b-4866-b9c4-b3af430e460a","resolution":{"observed_at":"2026-08-07T12:52:44.360480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:51.075416Z","title":null,"venue":null,"work_id":"c460fb48-1c61-4097-ad64-04591c48cf88","year":2019},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:44.524819Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:50fc5d03e689594b81521944e3b39024935b6312ff581de921820395a89ea43e","observation_id":"f33e1d90-fa99-4a87-ba0d-ebb038698a5e","resolution":{"observed_at":"2026-08-07T12:52:51.143213Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:50.851093Z","title":"13035–13045","venue":null,"work_id":"0649c37c-441a-480f-9cf0-aa5c9eabe0cb","year":2020},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:44.675623Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:d6fc669d9f44bbfb5732c67ba73499603a338d0fd0dcb007dce4c4495f20acb8","observation_id":"619ce196-557d-4234-a37b-8be37228eae5","resolution":{"observed_at":"2026-08-07T12:52:50.963362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:50.703719Z","title":null,"venue":null,"work_id":"8277e04a-d49c-47ff-be38-3ee0a923d8b7","year":2022},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:44.829181Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:2473929a62ee28049b3dae9a3927cab4a74b0c47c445e5a9921a2aec960ea955","observation_id":"771492b5-9dd1-4e5a-908c-30499c358417","resolution":{"observed_at":"2026-08-07T12:52:50.768170Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:44.950358Z","title":"Changpinyo, P","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:44.950358Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:043883cfea1a6b298865f06140c2ec84c192db406a93ed09ae4e7a3c67820bb1","observation_id":"eaa26ee6-5c18-4998-ad25-3464b4440290","resolution":{"observed_at":"2026-08-07T12:52:44.950358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:50.493293Z","title":"Kullback, R","venue":null,"work_id":"11a728cc-70db-4531-89eb-924562fd09d0","year":1951},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:45.091862Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:d097476563caf138fb6fd52c0ca19523c63f37f1bf5b803a73593bf20e4114d1","observation_id":"1faceee6-58c1-42c1-a747-6b0968ee5f17","resolution":{"observed_at":"2026-08-07T12:52:50.556760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-07T12:52:45.252289Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:45.252289Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:fb5074756fdf24032fd298a59a782f7f3e4beff55fc18766afa6d61837d7418d","observation_id":"a9da7bcf-96d6-4e97-aa27-d303f3179f4c","resolution":{"observed_at":"2026-08-07T12:52:45.252289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:50.329937Z","title":"Papineni, S","venue":null,"work_id":"459230d5-990c-477a-93db-3eceea94b380","year":2002},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:45.322179Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:8212d5343def3f55c581be7313aac5fb11a29927ab696cd13f836fef3b40f7e7","observation_id":"7632d89f-de66-4896-af43-b06f96587e43","resolution":{"observed_at":"2026-08-07T12:52:50.405269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:50.117541Z","title":"Banerjee, A","venue":null,"work_id":"dca051c2-1979-42fd-89a9-2ef710c18a17","year":2005},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:45.478971Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:c56e23a10fa7459fe43d91f165f59aa1d00cdf13c92f78b038f4624433d455c9","observation_id":"3504e205-b35a-4e11-a653-83c1f2407f11","resolution":{"observed_at":"2026-08-07T12:52:50.178964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:49.884092Z","title":"Lin, Rouge: A package for automatic evaluation of summaries, in: Text summarization branches out: Proceedings of the ACL-04 workshop, 2004, pp","venue":null,"work_id":"f20ee895-2059-485a-bb1c-834505a26d8b","year":2004},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:45.626619Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:4ae2eb8c4890cbc6df41d451e28312121df51c27ba0c52393897af029b1f3fa6","observation_id":"1aea2639-4e4d-4a37-ba4e-f76a1944a962","resolution":{"observed_at":"2026-08-07T12:52:50.009788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:49.711661Z","title":"Vedantam, C","venue":null,"work_id":"06b78192-0a21-4cb4-8e7a-6b4fd9b6fb14","year":2015},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:45.757986Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:66a787ff124ca129514d2de390bb7f63d0292c006beb712875627de8468956a2","observation_id":"9225c830-2bce-45e3-a697-43c60fdde696","resolution":{"observed_at":"2026-08-07T12:52:49.793273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:49.463481Z","title":"Kirkpatrick, R","venue":null,"work_id":"c1e969c0-c69e-44cf-858f-7025325ad57d","year":2017},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:45.859012Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:fc8f37d0f31d12e2298473bf23958cb16c1a3c02aeb3200be05e11480a84e9b2","observation_id":"301c5f23-0b3f-4bc1-8635-bf8b1b7805f3","resolution":{"observed_at":"2026-08-07T12:52:49.605423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:49.255738Z","title":null,"venue":null,"work_id":"0bd5ec6f-83a9-4b12-91b8-e89461865063","year":2020},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:45.945542Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:b906bdef61d1a6de0e7514bae4694432526e7528b4693fbaf6086457ed6d027d","observation_id":"210021e2-202f-45f3-968e-251efdbd32d1","resolution":{"observed_at":"2026-08-07T12:52:49.376017Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:49.060362Z","title":null,"venue":null,"work_id":"ed3f51aa-457f-4dad-8e85-ec8c341d2be9","year":2021},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:46.100120Z"},"links":{"citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:a8d133c2d7c3b990010fbeb981e43d47c0c90cde8e9f8dba5661858227de4b1c","observation_id":"57f827d0-533d-40e0-9a1d-80b3884f9dbc","resolution":{"observed_at":"2026-08-07T12:52:49.146830Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","snapshot_observed_at":"2026-08-04T10:22:52.279940Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04544","snapshot_observed_at":"2026-08-07T12:52:46.278075Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:46.278075Z"},"links":{"cited_paper":"/paper/2110.04544","citing_paper":"/paper/2505.23358"},"observation_digest":"sha256:76934ca470376c6b6618fe2678914fb1c06a42e72f16461bfab65bc27472fad4","observation_id":"e0bfc597-ddae-4ac7-9bf9-2bf7e9f83ac8","resolution":{"observed_at":"2026-08-07T12:52:46.278075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23358","last_updated":"2025-05-29T11:33:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T02:12:28.249955Z","submitted_at":"2025-05-29T11:33:36Z","title":"Beam-Guided Knowledge Replay for Knowledge-Rich Image Captioning using Vision-Language Model"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":37,"verified_exact":8,"verified_fuzzy":21},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2505.23358."}