{"as_of":"2026-08-07T10:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1d6c9ca42cf5afeaed7cc7ac0413ed5e69fdab44bab209e1eed6b42cec146c28","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:18:51.876640Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.08710/citation-record","integrity":"/paper/2507.08710/integrity","json":"/paper/2507.08710/citation-record.json","paper":"/paper/2507.08710"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.535507Z","title":"Learning cnn-lstm architectures for image caption generation,","venue":null,"work_id":"963887a1-30d8-4570-b2bc-f2c17dc8bafb","year":2016},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:44.496453Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:3c2c47900f5e327f3649ffa406c3f04a365ca153acaccb725d45be44bde4996a","observation_id":"af9e9b67-ed51-43f0-a289-8f9970342520","resolution":{"observed_at":"2026-08-06T18:19:58.538709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.524145Z","title":"Image captioning through image transformer,","venue":null,"work_id":"82f333e8-df4f-4f43-972d-9e9627de4327","year":2020},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:44.581263Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:9ba8172d6ffa75045723af6ed9f5a504b07b238519776cc37b63786a75936837","observation_id":"98920df9-8da1-4c92-b48d-4e976d93e013","resolution":{"observed_at":"2026-08-06T18:19:58.528365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.512171Z","title":"Meshed-memory transformer for image captioning,","venue":null,"work_id":"9f306b7d-1461-4f01-984f-b80c944554c2","year":2020},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:44.763308Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:c5982329609edcb6b1709e31db4376f0eafd9ba4530ca7d4cef65ef6cac561ad","observation_id":"2b78848c-363e-4dbb-818d-7779191acc0b","resolution":{"observed_at":"2026-08-06T18:19:58.517298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.499876Z","title":"Bottom-up and top-down attention for image captioning and visual question answering,","venue":null,"work_id":"758c64a9-edb0-4526-848c-9be3d4c18917","year":2018},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:44.883631Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:4d17e461204ced1ad86fd59bc9cdfd57419c710e5dbcb84bf4b8aa67dc5a4113","observation_id":"724a695d-4006-446b-b5d5-c6b7680e669c","resolution":{"observed_at":"2026-08-06T18:19:58.505011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:45.008929Z","title":"Self- critical sequence training for image captioning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:45.008929Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:8725b587aa1332449afd8799c74677ffa693d738563554c3a48f64c49e050c9a","observation_id":"3a749b07-904b-437b-a0b3-6be7fa4d1177","resolution":{"observed_at":"2026-08-06T18:18:45.008929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.478264Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image cap- tioning,","venue":null,"work_id":"50127bcb-7db6-4849-996e-b94f9d68c43b","year":2018},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:45.151174Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:45c34aa1ed37f37a77a330e014414fad75d72558980689613008986cdd9abeea","observation_id":"21ca654c-8798-4748-ae07-cac4c4654afa","resolution":{"observed_at":"2026-08-06T18:19:58.482559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:45.215989Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:45.215989Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:4b1027f045b43c5bff08e04cab24f71defe7e88772d5e00494e4dc78c9181c3b","observation_id":"6233736e-00d0-45bb-a043-a7cba9c56470","resolution":{"observed_at":"2026-08-06T18:18:45.215989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:45.325805Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:45.325805Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:ffa507c2bb727cf82026504aecc9811e1a334ffda82dfe3dfb0f67bd17244dcc","observation_id":"8fe3c809-e63e-4f17-ae2a-7ed19de952a0","resolution":{"observed_at":"2026-08-06T18:18:45.325805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:45.401247Z","title":"Cider: Consensus- based image description evaluation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:45.401247Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:6a5e301e392cce4e2f7ea9f4abdccdd81929124770322c428bf2f30ae7f709d5","observation_id":"c7189918-21d6-4020-a0d7-b828d7412d6d","resolution":{"observed_at":"2026-08-06T18:18:45.401247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.448732Z","title":"Bertscore: Evaluating text generation with bert,","venue":null,"work_id":"b961a284-ed9f-4b14-9eab-245ca4fdc81f","year":null},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:45.492571Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:700020a05b1de388dbf1f70c532ddf853a558ac3a1bce2fe511b30b0ff380468","observation_id":"1a1376e0-81c8-435b-9c09-1c69de0c4497","resolution":{"observed_at":"2026-08-06T18:19:58.451864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.439444Z","title":"What you see is what you read? improv- ing text-image alignment evaluation,","venue":null,"work_id":"d904ecb4-0dad-4593-bef1-6023f1fa8e4b","year":2023},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:45.585156Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:bf89bb7bb7b4eb1057741a644ee55023f307687b86ef6b05190d5ce2f103ce9d","observation_id":"196d3fa2-6bb0-4897-a325-0db460aa2a3f","resolution":{"observed_at":"2026-08-06T18:19:58.442462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.429631Z","title":"Fast, accurate, and lightweight memory-enhanced embedding learning framework for image-text retrieval,","venue":null,"work_id":"bf5b5233-7507-48e3-bd52-f6c61e7f32fa","year":2024},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:45.683674Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:6a17bf1b1681f6d0fd8028450f65bf444258d84e094d3f4d2796fbf64a9aa67f","observation_id":"738d87d5-2d8d-40ca-a429-d349426f4e66","resolution":{"observed_at":"2026-08-06T18:19:58.432955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.412282Z","title":"Vilbertscore: Evaluating image caption using vision-and-language bert,","venue":null,"work_id":"30e3c2bd-b379-4cc7-8bfb-fbed878e8eeb","year":2020},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:45.769679Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:5a2551a820d4c01f73f166016fb7e753a638cd9736f9277b62395b4fbfc7aaf0","observation_id":"34fd9183-3893-4f64-bb97-884567a1abe8","resolution":{"observed_at":"2026-08-06T18:19:58.421682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.390397Z","title":"Image-text alignment and retrieval using light-weight transformer,","venue":null,"work_id":"f7822d92-6865-4758-9911-c629232eb339","year":2022},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:45.864014Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:b0b1254ed8357026400c60b83875cbc0c3401465b100aba12434fbf205b99e38","observation_id":"16462428-c0fa-474d-a16c-51ad33ce8d5e","resolution":{"observed_at":"2026-08-06T18:19:58.396031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.14019","last_updated":"2021-06-26T13:27:14Z","snapshot_observed_at":"2026-08-05T20:54:54.151486Z","submitted_at":"2021-06-26T13:27:14Z","title":"UMIC: An Unreferenced Metric for Image Captioning via Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.14019","snapshot_observed_at":"2026-08-06T18:18:45.987661Z","title":"Umic: An unreferenced metric for image captioning via contrastive learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:45.987661Z"},"links":{"cited_paper":"/paper/2106.14019","citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:362cdefd7f659715b7b5bcf7a370a0331840295716a14561b9fd3519426dc271","observation_id":"b86d9278-ae41-4bd3-929a-1f025224a9f0","resolution":{"observed_at":"2026-08-06T18:18:45.987661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.378386Z","title":"Less is more: Clipbert for video-and-language learning via sparse sampling,","venue":null,"work_id":"cdd60c32-b7c8-4e6d-a43c-44dc5ac0dd90","year":2021},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:46.060303Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:b764f4fbcb0d05b3d199746af9b35fa41aa99cbbe1c6435bf90c1215d33ff140","observation_id":"b11e06f7-676b-404a-b3d5-0d11a036e1a1","resolution":{"observed_at":"2026-08-06T18:19:58.382031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.362626Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks,","venue":null,"work_id":"bcc35bda-a582-4088-b4fa-3836db8063b9","year":2019},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:46.129387Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:4623044d3322e13272dace88eca83a7055aa20460cf63879f4b7b3e60872bff9","observation_id":"523b857d-58f0-4d9e-94a8-81e3b919172a","resolution":{"observed_at":"2026-08-06T18:19:58.369989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.342548Z","title":"Quality estimation for image captions based on large-scale human evaluations,","venue":null,"work_id":"0fa4e095-04a3-43d5-b0b3-fad6332e534b","year":2021},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:46.244803Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:ee27c3fc462bae63b52d67a913eca758c388f6db57c04a40be851c8afa19aec9","observation_id":"10672b9f-a868-466f-8a6c-b1c479216c38","resolution":{"observed_at":"2026-08-06T18:19:58.346489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.325145Z","title":"Revealing the dark secrets of bert,","venue":null,"work_id":"a3d08933-d890-4f43-b935-296816d849bd","year":2019},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:46.370999Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:41bfd60b8055b49387f16a6f707e1d52e5effce4b59dc8bc016eb65122916947","observation_id":"067683fa-cef1-4c83-811c-27ee9be55865","resolution":{"observed_at":"2026-08-06T18:19:58.328710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.311681Z","title":"Minivit: Compressing vision transformers with weight multiplexing,","venue":null,"work_id":"f6d828fb-a853-43b1-b164-1ad0078916fa","year":2022},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:46.521919Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:624b36b96ce4cdba7ba0f45b99581110ea7360be0b7c5133d2d366283a5dd2dd","observation_id":"104ac830-39ae-4fed-9f7f-ce993210402d","resolution":{"observed_at":"2026-08-06T18:19:58.318090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11942","last_updated":"2020-02-09T03:00:18Z","snapshot_observed_at":"2026-07-06T08:24:44.631342Z","submitted_at":"2019-09-26T07:06:13Z","title":"ALBERT: A Lite BERT for Self-supervised Learning of Language Representations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11942","snapshot_observed_at":"2026-08-06T18:18:46.607900Z","title":"Albert: A lite bert for self-supervised learning of language representa- tions,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:46.607900Z"},"links":{"cited_paper":"/paper/1909.11942","citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:73d19d3757fa228952cf0e16d941fc9bde4afcc8fa60f880ba7e355873d95059","observation_id":"8ad54b67-70ec-4ebe-9c0d-6cd9ca908c74","resolution":{"observed_at":"2026-08-06T18:18:46.607900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.264467Z","title":"Enabling multimodal generation on clip via vision-language knowledge distilla- tion,","venue":null,"work_id":"b6b17e39-ed63-4dcf-ba1b-0daf67ceacea","year":2022},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:46.699499Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:3acebd8caf6b5d8126701b666b299811f6a0349683af0c8d66b74b14a665a8d1","observation_id":"ee9aa492-63a3-4d64-b84b-55e70a95c154","resolution":{"observed_at":"2026-08-06T18:19:58.291873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.05729","last_updated":"2022-12-28T20:07:58Z","snapshot_observed_at":"2026-08-04T18:38:43.107232Z","submitted_at":"2022-01-15T01:54:01Z","title":"CLIP-TD: CLIP Targeted Distillation for Vision-Language Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.05729","snapshot_observed_at":"2026-08-06T18:18:46.816291Z","title":"Clip-td: Clip targeted distillation for vision-language tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:46.816291Z"},"links":{"cited_paper":"/paper/2201.05729","citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:f793e52e35596bd64cb624165a26c08af61c2f52168e8142ef47e6540e9fafd6","observation_id":"65ec115c-e93a-478d-a9bb-c43a8a8ca597","resolution":{"observed_at":"2026-08-06T18:18:46.816291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:46.902472Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:46.902472Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:c33dcef6a365b2fe630110dd8922084d4bdc472f78843217bb01c87c60650497","observation_id":"60ba08d4-fc9b-4506-a040-d906a169dae3","resolution":{"observed_at":"2026-08-06T18:18:46.902472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.215242Z","title":"Sca-cnn: Spatial and channel-wise attention in convolutional networks for image captioning,","venue":null,"work_id":"6ee045b1-f8ee-464d-b6ba-bb921ce1fc31","year":2016},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:47.017461Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:9eaf44ad8445e06d9714adf33c3e1f3268a70c83cc58d1572e6017236c692c70","observation_id":"c0f769db-72fa-4407-b8cd-bcbe1e6ffbd3","resolution":{"observed_at":"2026-08-06T18:19:58.226808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:19:58.159954Z","title":"Knowing when to look: Adaptive attention via a visual sentinel for image captioning,","venue":null,"work_id":"77264519-a93a-40d0-b4b4-d13dc733da6a","year":2017},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:47.108684Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:14ab3aae1e87d141078102002c9175aeddbd9e48bd619adecdfeaa57c45ece02","observation_id":"571e6b59-0e11-4213-bfca-acffcc3b3899","resolution":{"observed_at":"2026-08-06T18:19:58.182859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:57.318086Z","title":"Know more say less: Image captioning based on scene graphs,","venue":null,"work_id":"f6513a60-18b0-4dcf-b343-76272d65ea00","year":2019},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:47.214435Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:fc358ff1d8ad8d7b8c0efbb39df3eaaf83d5758d96eb45f3c1362d2016268585","observation_id":"c435e904-4efc-468e-90e1-77a151c923e6","resolution":{"observed_at":"2026-08-06T18:18:57.441150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:57.044815Z","title":"High-quality image cap- tioning with fine-grained and semantic-guided visual attention,","venue":null,"work_id":"909df86f-8b76-4f8b-85d1-ac019ac59fcb","year":2018},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:47.379950Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:1edbf316c0465a701f0e75190dc862edabcc49c0c72a185a6c2f0120f55fc74c","observation_id":"9192a4e7-23b4-4c75-aad3-0e2a41fc051a","resolution":{"observed_at":"2026-08-06T18:18:57.142395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:56.857544Z","title":"Multimodal transformer with multi- view visual representation for image captioning,","venue":null,"work_id":"d3e34999-5a7f-41e8-aaaf-64969bea5642","year":2019},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:47.450394Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:42f10d3a3b5845027fc97ea0ec148561be837c96eb6add31fa898e0a797445a6","observation_id":"45cf7118-9da8-4cb3-b021-9ce38f332a1e","resolution":{"observed_at":"2026-08-06T18:18:56.954306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:56.682345Z","title":"Compact bidirectional transformer for image captioning,","venue":null,"work_id":"06b7a8cb-a4f6-490c-8b9d-c25059704f8c","year":2022},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:47.571278Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:92ce57b0bc53881cecb1f387e25a3ba52d3a3557cf9177b076653e7f98ed5885","observation_id":"9dbb5512-162e-4619-b482-2081258a674a","resolution":{"observed_at":"2026-08-06T18:18:56.756704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:56.413672Z","title":"Task-adaptive attention for image captioning,","venue":null,"work_id":"5fb2fb87-d728-4649-8cf9-1510e4735cbd","year":2021},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:47.661175Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:71dc82454ce97fdaf5d59de7dbd761d2ae517753ffe01473fb032131d3d17e55","observation_id":"58c688ad-e4fc-45fb-a40f-f41e3ad78348","resolution":{"observed_at":"2026-08-06T18:18:56.571741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:56.146463Z","title":"Textual context-aware dense captioning with diverse words,","venue":null,"work_id":"6b71c162-42e7-460c-80c2-b7e8fd36548d","year":2023},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:47.728248Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:23526c4c414284d2f5f081157ae61a9306479af7f68ccfd9d495ecad7ce288fa","observation_id":"b8faab56-4325-4121-a7fa-e0fc61873d7c","resolution":{"observed_at":"2026-08-06T18:18:56.262369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:47.800623Z","title":"Meteor: An automatic metric for mt evalua- tion with improved correlation with human judgments,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:47.800623Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:090d5b336e8363d9177fb37c7f5474c96b53425e9cd72e56efbfa31bac1b5830","observation_id":"46457da1-e0aa-4070-8373-e2adfac91838","resolution":{"observed_at":"2026-08-06T18:18:47.800623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:47.891704Z","title":"Rouge: A package for automatic evaluation of summaries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:47.891704Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:03c64adea3a11a80c71e55718da80b3c69248f31116cfb3022dbfc769141820d","observation_id":"a5722b42-588b-466a-be6c-900b74189f3e","resolution":{"observed_at":"2026-08-06T18:18:47.891704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:47.956604Z","title":"Spice: Semantic propositional image caption evaluation,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:47.956604Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:1481e2d3091b27ead4c7ba8ada87d5d7d5ba3eb3e38f8e6e4aedfe2863d09391","observation_id":"b440dc69-0d02-42c1-a27d-3735867b32a8","resolution":{"observed_at":"2026-08-06T18:18:47.956604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T18:18:48.077301Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:48.077301Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:69a83b41603f031d1b7380556998528721e5f0596b759f2cb9267dcb70acd02d","observation_id":"9266a018-e0eb-40f0-a5ec-d9b3eb341cf1","resolution":{"observed_at":"2026-08-06T18:18:48.077301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:55.887518Z","title":"Clipscore: A reference-free evaluation metric for image captioning,","venue":null,"work_id":"8e89bd9c-1d42-4028-9728-eb55d8898fc0","year":2021},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:48.194780Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:ec3afaf37b8433949b26910323427d99a57c86eb88a3e6beb907c1e9ffae2b63","observation_id":"ac99a651-3121-4d31-8668-a42d84296387","resolution":{"observed_at":"2026-08-06T18:18:55.989883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:55.610754Z","title":"Tiger: Text-to-image grounding for image caption evalua- tion,","venue":null,"work_id":"a7f60590-4383-4410-8608-6fe1f42b7a9a","year":2019},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:48.326568Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:be07d48a4b98b69ea5bf144e4f68bcb44587cd91df9671f302920c185632e74b","observation_id":"9e56f2de-0a44-46f0-8363-b3366ecad143","resolution":{"observed_at":"2026-08-06T18:18:55.753289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:55.406854Z","title":"Em- score: Evaluating video captioning via coarse-grained and fine-grained embedding matching,","venue":null,"work_id":"dbd7a6c2-32b9-42d2-be9a-0c15d33131aa","year":2022},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:48.435085Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:2b12d55e6cfe7372ca7fcb15be0cc7dda77e7c5e4b98bf9526062a4d88e6c285","observation_id":"473024b0-5264-48ed-91fa-011520487af3","resolution":{"observed_at":"2026-08-06T18:18:55.505044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:48.555233Z","title":"Gpt-3: Its nature, scope, limits, and consequences,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:48.555233Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:34f31d64e37551390cc3d5dfa3b31fb6ff62dbdba45963db90da3944acfb6279","observation_id":"2bebff7b-075d-4dc3-9477-81a543bc9c20","resolution":{"observed_at":"2026-08-06T18:18:48.555233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:55.121439Z","title":"Bart: Denoising sequence-to-sequence pre-training for natural language generation, translation, and comprehen- sion,","venue":null,"work_id":"42085db5-2462-48de-b6b3-751305c57f85","year":2020},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:48.636684Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:4515ead6d588c5a0b85481146fcc1bb42454ab1101b4e425f8e5f3fd6ff32d0b","observation_id":"0e0d5cf6-ec6d-4216-9234-d04b0fb41152","resolution":{"observed_at":"2026-08-06T18:18:55.274386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:48.724702Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:48.724702Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:9f8a6cfd26ec7cf513d25a06610e73b92a2d26f5fd77f497a2a9ad4f78477211","observation_id":"1b91fbc6-9386-456e-9543-9953ab43f225","resolution":{"observed_at":"2026-08-06T18:18:48.724702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10442","last_updated":"2022-08-31T02:26:45Z","snapshot_observed_at":"2026-07-06T13:44:15.000595Z","submitted_at":"2022-08-22T16:55:04Z","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10442","snapshot_observed_at":"2026-08-06T18:18:48.992310Z","title":"Image as a foreign language: Beit pretraining for all vision and vision-language tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:48.992310Z"},"links":{"cited_paper":"/paper/2208.10442","citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:c4a0e3bb57f794cfec7ff4eb666ff791285ce69104fcb76d7bb5750d4115b586","observation_id":"2f07502a-6d12-430e-8cbe-bf26a807362b","resolution":{"observed_at":"2026-08-06T18:18:48.992310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08530","last_updated":"2020-02-18T02:59:17Z","snapshot_observed_at":"2026-08-05T12:33:51.708082Z","submitted_at":"2019-08-22T17:59:30Z","title":"VL-BERT: Pre-training of Generic Visual-Linguistic Representations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08530","snapshot_observed_at":"2026-08-06T18:18:49.108576Z","title":"Vl-bert: Pre-training of generic visual-linguistic representations,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:49.108576Z"},"links":{"cited_paper":"/paper/1908.08530","citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:4cbccf7ab732875c19afc12ce27e8ecc534d18df1614c16830d59ece7b33aeea","observation_id":"e4c820e8-97fb-4d58-8dae-ad870c5dcfc1","resolution":{"observed_at":"2026-08-06T18:18:49.108576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:54.849343Z","title":"Slip: Self-supervision meets language-image pre-training,","venue":null,"work_id":"f98bd169-3449-4643-b404-027c75b9d90a","year":2022},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:49.294938Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:eb026930beb704b5006b511938e03a8610872330c4b45ad5f40344cb6c4d1474","observation_id":"671a853a-d350-4185-a7bd-c000fcfee516","resolution":{"observed_at":"2026-08-06T18:18:54.996841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1608.08710","last_updated":"2017-03-10T17:57:56Z","snapshot_observed_at":"2026-07-06T05:08:42.861486Z","submitted_at":"2016-08-31T02:29:59Z","title":"Pruning Filters for Efficient ConvNets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.08710","snapshot_observed_at":"2026-08-06T18:18:49.439407Z","title":"Pruning filters for efficient convnets,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:49.439407Z"},"links":{"cited_paper":"/paper/1608.08710","citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:ce5f25ec6417d779fdcc806fff4b7cc1c50277aba6994a4e306d4c0539964cf9","observation_id":"d5a17254-2f11-44e3-be44-f90bd97b8975","resolution":{"observed_at":"2026-08-06T18:18:49.439407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08500","last_updated":"2021-08-14T06:06:37Z","snapshot_observed_at":"2026-07-06T11:00:50.937337Z","submitted_at":"2021-04-17T09:49:24Z","title":"Vision Transformer Pruning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08500","snapshot_observed_at":"2026-08-06T18:18:49.586224Z","title":"Vision transformer pruning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:49.586224Z"},"links":{"cited_paper":"/paper/2104.08500","citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:53f3c8b3d3dde7f7300f737af877bc224989dc199c5306c2ec7033249c91309a","observation_id":"ede5327c-922a-4ed8-9555-cb7fb26c0b0c","resolution":{"observed_at":"2026-08-06T18:18:49.586224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:54.568318Z","title":"Post-training quantization for vision transformer,","venue":null,"work_id":"97f4807d-0e77-48c0-be77-afddd227086e","year":2021},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:49.787638Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:8716d260deca16e4e6d633c7acb3f8eaca558806e01fd1cd3870579d08844c58","observation_id":"df4b184b-157f-4be5-a4cf-3c00dbcc0f2f","resolution":{"observed_at":"2026-08-06T18:18:54.652256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:54.343780Z","title":"Tinyvit: Fast pretraining distillation for small vision transformers,","venue":null,"work_id":"8679dd88-972f-44de-bb0d-15e317e1aa15","year":2022},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:49.905742Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:7aa6c4b9463ca9cdb133a9d3025ca9a682da1a9d330b6e8689ffc750e1dbff9f","observation_id":"0505ab65-2ef6-496c-98ae-c4ec38866818","resolution":{"observed_at":"2026-08-06T18:18:54.444617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:54.199508Z","title":"Tinybert: Distilling bert for natural language understanding,","venue":null,"work_id":"237c99d2-2519-457e-b09e-9bc523192764","year":2020},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:50.076329Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:38cf0290060c79b98c438876e6a26ba77c7e26b9212f69d148eef0680a208632","observation_id":"0b0011c6-d04c-4753-abb2-3a5bdf78d27f","resolution":{"observed_at":"2026-08-06T18:18:54.259692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-03T03:32:02.223426Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-06T18:18:50.162524Z","title":"Distilbert, a distilled version of bert: smaller, faster, cheaper and lighter,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:50.162524Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:f048bd448de81c08c595546da3e3da7406616895d8524544288f7e291ee5acde","observation_id":"2b89c3d1-403f-4093-b9d5-8456c1de0eb0","resolution":{"observed_at":"2026-08-06T18:18:50.162524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:50.303885Z","title":"Training data-efficient image transformers & distillation through attention,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:50.303885Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:b8ad9fcb858ff356fa0688c0c954d5b4fa73f153fd0c04fddbb0000e4319b4ef","observation_id":"b39e71e5-76e7-4887-a9a7-cdab83f87c18","resolution":{"observed_at":"2026-08-06T18:18:50.303885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:50.460291Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:50.460291Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:e35a197eaf1cd1d23757f2b7abc0cd2cf8b61c21c78e3e7e3b444ced1ec9f97d","observation_id":"57e846a7-95fc-4f08-b549-f0006eaa6703","resolution":{"observed_at":"2026-08-06T18:18:50.460291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T18:18:50.608287Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:50.608287Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:08bdb4af0c74bc5a2ea9d5004c6fa7a45006bc750046ac8249bdd6acb43cf9bc","observation_id":"507da7cf-40af-4f7e-b50a-a3421316f702","resolution":{"observed_at":"2026-08-06T18:18:50.608287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:53.992303Z","title":"Bag of tricks for image classification with convolutional neural networks,","venue":null,"work_id":"f3eda01d-2f93-4a0d-bcc6-acd66a71dda2","year":2019},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:50.761420Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:257d4f64498e093f2ca101c4ab0a33a9d84ae9163c6553b1bac1b74b30a16736","observation_id":"6b05c5f1-1756-47bf-91a4-56717f2c1ae2","resolution":{"observed_at":"2026-08-06T18:18:54.104734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:53.707353Z","title":"Making convolutional networks shift-invariant again,","venue":null,"work_id":"d2243788-3703-4c20-83a5-58cd5f1d24b5","year":2019},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:50.886873Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:63df12da49cb083d3a49fc4c51adfc0c2a4af7977494f2ce254c201a394703c3","observation_id":"4af3bb92-6134-416d-b4aa-62c6937a5550","resolution":{"observed_at":"2026-08-06T18:18:53.800069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:53.397261Z","title":"Discriminability objective for training descriptive captions,","venue":null,"work_id":"7cf8aad8-fea5-46b6-8fbe-15e5b44a5f82","year":2018},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:50.986021Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:4c8d3fc02e8d56aa9c263b28a4ab76311924f3ff2f0f4ce0d75ef0c98454a3c5","observation_id":"20d691ff-b298-4771-935b-70f04e205385","resolution":{"observed_at":"2026-08-06T18:18:53.570868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:51.056134Z","title":"ImageNet Large Scale Visual Recognition Challenge,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:51.056134Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:cb3c7ba13b6e5657c703a36208270cea2f091d04508365923eec1a3e16b518dc","observation_id":"07f51bdc-c850-49b2-81e8-fb98b53f422f","resolution":{"observed_at":"2026-08-06T18:18:51.056134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:53.185664Z","title":"Framing image description as a ranking task: Data, models and evaluation metrics,","venue":null,"work_id":"c75a2b59-dc15-4d92-a073-d5e15db0affd","year":2013},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:51.171017Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:ccb33903acf31d937bcf5457e15aed6637654c7d26d7fef18aebb292f2dc22a8","observation_id":"2ba5db4d-d95c-41f0-a492-b0611a25abff","resolution":{"observed_at":"2026-08-06T18:18:53.266631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.03292","last_updated":"2015-11-10T21:14:51Z","snapshot_observed_at":"2026-07-06T04:36:02.911118Z","submitted_at":"2015-11-10T21:14:51Z","title":"From Images to Sentences through Scene Description Graphs using Commonsense Reasoning and Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.03292","snapshot_observed_at":"2026-08-06T18:18:51.241514Z","title":"From im- ages to sentences through scene description graphs using commonsense reasoning and knowledge,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:51.241514Z"},"links":{"cited_paper":"/paper/1511.03292","citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:f7dabd63d2f35aab0182257369ca047d114be7a3e5b57fd3c04f2ab1aa5edf2b","observation_id":"fa8cb4f5-4a9b-4e46-b2d8-af3aa3151a8b","resolution":{"observed_at":"2026-08-06T18:18:51.241514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:52.874512Z","title":"Consensus-based image description evaluation,","venue":null,"work_id":"ca082268-5e1c-4763-8653-c4dc04bb7a03","year":null},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:51.305407Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:ac01e1faa8ab9925a43d25e19f80aaddafebbf62c4e535811bf1e31b8d9a110f","observation_id":"b5ca7f10-23d0-4445-9220-275089ddd46e","resolution":{"observed_at":"2026-08-06T18:18:53.042948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:52.606334Z","title":"Foil it! find one mismatch between image and language caption,","venue":null,"work_id":"0f0a225e-b11f-4c67-8a2e-0c69320a6b9f","year":2017},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:51.395791Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:96cd103e0d0d55f723ab72e09977ce02d6a4e2437f11fcc8476ff27f53cc3ecf","observation_id":"0433243b-fd85-4fcc-af24-11e652ff5144","resolution":{"observed_at":"2026-08-06T18:18:52.700175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:52.483763Z","title":"Deep visual-semantic alignments for gen- erating image descriptions,","venue":null,"work_id":"2d627b73-945b-4217-8848-762c209cbe7f","year":2015},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:51.477940Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:feb0e6708077b805aa353c02a7fe6c6887e48c971a6eab56a170fa00261dac1f","observation_id":"6705d649-e7d7-4e3f-9634-a4129066491c","resolution":{"observed_at":"2026-08-06T18:18:52.538573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:52.330490Z","title":"Vinvl: Revisiting visual representations in vision-language models,","venue":null,"work_id":"b65bb24e-22be-48d4-beaf-18c860d3864b","year":2021},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:51.554693Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:a8f269850c7490291b35cd250e76cde776d5ffde01a08aa09285132777a3afe1","observation_id":"24f8f060-4a72-4d69-a4fb-4b7d196df7b4","resolution":{"observed_at":"2026-08-06T18:18:52.392262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:52.197324Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":"90213cf7-82e5-4cdb-b92f-3cef9eeb4dd1","year":2014},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:51.640789Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:b9269839b0762bac8cce6a2125d162658a51e17f0a283cac5392fcfa98374a0a","observation_id":"8dd056fb-e566-42b9-a6c3-2a426bbf0ca9","resolution":{"observed_at":"2026-08-06T18:18:52.258827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:18:52.080141Z","title":"Improving image captioning evaluation by considering inter references variance,","venue":null,"work_id":"fb2c3078-0396-412b-b33b-6fc17cde5917","year":2020},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:51.705906Z"},"links":{"citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:6d4b3d41eb60ca51554567b1e463b43fd98ff949e5b2097d822ea3a42376c10c","observation_id":"fc4aa0b8-2168-462a-8dd9-58111a0fc563","resolution":{"observed_at":"2026-08-06T18:18:52.129394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-06T18:18:51.809319Z","title":"Concrete problems in ai safety,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:51.809319Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:0d3e1e0e9be87eb8e5af107638b68051ab5adfbbfc597ad2e9daefeca0b4b2b8","observation_id":"380b0f08-6362-4ce7-8203-5776db952ae8","resolution":{"observed_at":"2026-08-06T18:18:51.809319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04549","last_updated":"2024-07-05T14:34:50Z","snapshot_observed_at":"2026-08-03T03:39:29.907591Z","submitted_at":"2024-07-05T14:34:50Z","title":"Spontaneous Reward Hacking in Iterative Self-Refinement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04549","snapshot_observed_at":"2026-08-06T18:18:51.876640Z","title":"Spontaneous reward hacking in iterative self-refinement,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T18:18:51.876640Z"},"links":{"cited_paper":"/paper/2407.04549","citing_paper":"/paper/2507.08710"},"observation_digest":"sha256:64ab8584cdcafee58f7d648920ffeedb8a67e989beeb9b534f4ce4279e6b4745","observation_id":"61a01979-bf04-494a-9ff6-eac046908ce5","resolution":{"observed_at":"2026-08-06T18:18:51.876640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.08710","last_updated":"2025-07-11T16:08:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T07:41:16.968990Z","submitted_at":"2025-07-11T16:08:12Z","title":"L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":42},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2507.08710."}