{"as_of":"2026-08-22T21:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ac9a49bc1d4f30ef6306631023a751ba36d4f3fcaa5f74c29b3bf89298e5b437","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T22:24:10.018933Z","state":"measured"},{"denominator":170,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":170,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":302,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:40:26.477919Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":"2104.08718","doi":"10.48550/arxiv.2104.08718","metadata_source":"pith","pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","venue":"cs.CV","work_id":"2dd7e0b7-c69c-4976-a406-12d4f5b18d14","year":2021},"citing_paper":{"arxiv_id":"2205.11487","last_updated":"2022-05-23T17:42:53Z","snapshot_observed_at":"2026-08-17T05:51:02.087480Z","submitted_at":"2022-05-23T17:42:53Z","title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T07:38:53.056362Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2205.11487"},"observation_digest":"sha256:acf8acc90bbc6776580d722103594bbc8d1bac9751e7a859b8a5396003cc8524","observation_id":"3e05a268-b9aa-4494-9d9e-991c8767605e","resolution":{"observed_at":"2026-05-12T22:24:10.313148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":"2104.08718","doi":"10.48550/arxiv.2104.08718","metadata_source":"pith","pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","venue":"cs.CV","work_id":"2dd7e0b7-c69c-4976-a406-12d4f5b18d14","year":2021},"citing_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-08-21T17:27:27.238302Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T03:31:08.155347Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2210.02303"},"observation_digest":"sha256:898bfe0d8f23b25145bf84ccc5927a1038891c1988fb495a024ec15ae41d1592","observation_id":"f382ce3d-ff08-4109-aeb1-3ffe1ae8d0fa","resolution":{"observed_at":"2026-05-12T22:24:10.313148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":"2104.08718","doi":"10.48550/arxiv.2104.08718","metadata_source":"pith","pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","venue":"cs.CV","work_id":"2dd7e0b7-c69c-4976-a406-12d4f5b18d14","year":2021},"citing_paper":{"arxiv_id":"2302.12192","last_updated":"2023-02-23T17:34:53Z","snapshot_observed_at":"2026-08-20T08:43:12.373190Z","submitted_at":"2023-02-23T17:34:53Z","title":"Aligning Text-to-Image Models using Human Feedback","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T20:39:15.388881Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2302.12192"},"observation_digest":"sha256:13772cb631ccfc62c2376b7e393673d8801c5a8e74d02c6db0016e3189f20b8b","observation_id":"532d4690-053a-49ef-8c2a-a4e2d583282e","resolution":{"observed_at":"2026-05-14T20:39:15.457816Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":"2104.08718","doi":"10.48550/arxiv.2104.08718","metadata_source":"pith","pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","venue":"cs.CV","work_id":"2dd7e0b7-c69c-4976-a406-12d4f5b18d14","year":2021},"citing_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T23:57:08.818348Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2308.06721"},"observation_digest":"sha256:fc9f85343ca696ddb85cc3fb6bbae91579bf9da29f23f260a7b1b9e8bee4b40b","observation_id":"4cf7ff83-6c4a-4ffc-a753-dbbe32f9d8bd","resolution":{"observed_at":"2026-05-12T22:24:10.313148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":"2104.08718","doi":"10.48550/arxiv.2104.08718","metadata_source":"pith","pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","venue":"cs.CV","work_id":"2dd7e0b7-c69c-4976-a406-12d4f5b18d14","year":2021},"citing_paper":{"arxiv_id":"2310.04378","last_updated":"2023-10-06T17:11:58Z","snapshot_observed_at":"2026-08-20T13:49:06.053430Z","submitted_at":"2023-10-06T17:11:58Z","title":"Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-13T04:15:54.681913Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2310.04378"},"observation_digest":"sha256:8d0ae24d3bb1ebafcbb20b6eb450ae3fa01a55fd780038684e71db31fc547a60","observation_id":"bf94400b-41db-4346-8c84-434fbdfa2756","resolution":{"observed_at":"2026-05-13T04:15:54.769537Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":"2104.08718","doi":"10.48550/arxiv.2104.08718","metadata_source":"pith","pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","venue":"cs.CV","work_id":"2dd7e0b7-c69c-4976-a406-12d4f5b18d14","year":2021},"citing_paper":{"arxiv_id":"2410.05363","last_updated":"2024-10-07T17:56:04Z","snapshot_observed_at":"2026-08-08T09:48:34.424815Z","submitted_at":"2024-10-07T17:56:04Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-18T14:39:59.870039Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2410.05363"},"observation_digest":"sha256:60b2b8ef630fa6a2dc0d70b00069d35ec4a8cbf1235a1f926430ab18eb2060b8","observation_id":"c83e630a-ac9e-427d-a8be-13a06867ee99","resolution":{"observed_at":"2026-05-18T14:40:00.116699Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":"2104.08718","doi":"10.48550/arxiv.2104.08718","metadata_source":"pith","pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","venue":"cs.CV","work_id":"2dd7e0b7-c69c-4976-a406-12d4f5b18d14","year":2021},"citing_paper":{"arxiv_id":"2410.16431","last_updated":"2026-04-21T16:52:58Z","snapshot_observed_at":"2026-08-14T12:59:04.568582Z","submitted_at":"2024-10-21T18:51:34Z","title":"Conjuring Semantic Similarity","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T18:23:28.453668Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2410.16431"},"observation_digest":"sha256:3c721919018bb32908227cfaae36ec016e593d536e6f9ce7d53c9dc8b547862a","observation_id":"3f4bcff5-5a23-4bb7-95f1-3da24cecfde4","resolution":{"observed_at":"2026-05-23T18:25:44.737937Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-12T20:20:21.311773Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09823","last_updated":"2024-11-14T22:15:48Z","snapshot_observed_at":"2026-08-20T03:17:44.169390Z","submitted_at":"2024-11-14T22:15:48Z","title":"Architect: Generating Vivid and Interactive 3D Scenes with Hierarchical 2D Inpainting","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T20:20:21.311773Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2411.09823"},"observation_digest":"sha256:373b1dffc3823680aeb7f96c19b4e5e97d2787f8722a2dfa8979313621ed0f38","observation_id":"ad3a7949-d2d1-4a50-939d-1e597b4e39ac","resolution":{"observed_at":"2026-08-12T20:20:21.311773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-12T20:08:23.480680Z","title":"& Choi, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10004","last_updated":"2024-11-15T07:30:53Z","snapshot_observed_at":"2026-08-22T19:49:18.599822Z","submitted_at":"2024-11-15T07:30:53Z","title":"EyeDiff: text-to-image diffusion model improves rare eye disease diagnosis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T20:08:23.480680Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2411.10004"},"observation_digest":"sha256:65ec11b8cd2ec35fa37ae48ad6da11c1374d3ddbe967b9895c21814edfb874c0","observation_id":"30174a36-9f24-4152-8030-1b1e9bdcbaee","resolution":{"observed_at":"2026-08-12T20:08:23.480680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-12T19:56:48.527929Z","title":"Clipscore: A reference-free evaluation metric for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10164","last_updated":"2024-11-15T13:12:47Z","snapshot_observed_at":"2026-08-17T15:06:53.093186Z","submitted_at":"2024-11-15T13:12:47Z","title":"Evaluating Text-to-Image Diffusion Models for Texturing Synthetic Data","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T19:56:48.527929Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2411.10164"},"observation_digest":"sha256:66220a54332991db1579bcef0bcb59179ddfb6c275c944eda48ef85c98718667","observation_id":"c0b7e64d-ae09-423b-bb5e-a07d329a571c","resolution":{"observed_at":"2026-08-12T19:56:48.527929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-12T19:54:42.505048Z","title":"Clipscore: A reference-free evaluation metric for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10183","last_updated":"2024-11-15T13:32:23Z","snapshot_observed_at":"2026-08-20T12:40:49.541477Z","submitted_at":"2024-11-15T13:32:23Z","title":"Visual question answering based evaluation metrics for text-to-image generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T19:54:42.505048Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2411.10183"},"observation_digest":"sha256:7fa36adc06db7a8a036f5a096decd892ee0ace08f747b7d718d48128ffee610c","observation_id":"52aa3298-4076-4ac3-8e9f-b977db37caee","resolution":{"observed_at":"2026-08-12T19:54:42.505048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-12T19:15:04.414955Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10913","last_updated":"2024-11-16T23:44:14Z","snapshot_observed_at":"2026-08-18T14:47:01.169429Z","submitted_at":"2024-11-16T23:44:14Z","title":"Generating Compositional Scenes via Text-to-image RGBA Instance Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T19:15:04.414955Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2411.10913"},"observation_digest":"sha256:d3d72085833c582450fb777f03a52d4314308cc3cc143686e882229357a02f8f","observation_id":"70f9dc59-cd9f-4d57-96a3-5af6691829c4","resolution":{"observed_at":"2026-08-12T19:15:04.414955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-12T18:22:17.142150Z","title":"L., and Choi, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11667","last_updated":"2025-01-31T23:36:04Z","snapshot_observed_at":"2026-08-20T08:51:42.714626Z","submitted_at":"2024-11-18T15:45:41Z","title":"Dissecting Representation Misalignment in Contrastive Learning via Influence Function","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-12T18:22:17.142150Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2411.11667"},"observation_digest":"sha256:8a58e95b38793fac3ab697000b0901e843c01de824902e82f9c5e888c6723056","observation_id":"2b75b1fc-8a75-4534-91d3-2fc71f924a85","resolution":{"observed_at":"2026-08-12T18:22:17.142150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-12T16:56:10.790044Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-15T05:37:09.605243Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.790044Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:69bf99fffbaf9a2ff1a32f6fe13548921a51ef40f27f09ff01be59e0ebd2d4dd","observation_id":"ebc38e85-ddbb-421a-9b7f-b89d83ba596a","resolution":{"observed_at":"2026-08-12T16:56:10.790044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-12T20:13:57.355821Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-20T13:09:54.981053Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.355821Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:ed919665aa4f92d27348fdb73ad1e45172a5312e0fa785f055c7908616191bed","observation_id":"dcebdad7-c22c-42f3-b06d-3063928ef62e","resolution":{"observed_at":"2026-08-12T20:13:57.355821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-12T14:19:08.426091Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15488","last_updated":"2024-11-23T08:06:06Z","snapshot_observed_at":"2026-08-15T01:31:53.645527Z","submitted_at":"2024-11-23T08:06:06Z","title":"Automatic Evaluation for Text-to-image Generation: Task-decomposed Framework, Distilled Training, and Meta-evaluation Benchmark","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:19:08.426091Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2411.15488"},"observation_digest":"sha256:05c2fb62917a0b0508e298370a2c94ee546fcce10dce4338bc843bbcd5a22454","observation_id":"a459fc08-649a-4f3d-af98-c2b4842c4d82","resolution":{"observed_at":"2026-08-12T14:19:08.426091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-12T14:11:24.769603Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning.arXiv preprint arXiv:2104.08718,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15580","last_updated":"2025-08-02T16:16:18Z","snapshot_observed_at":"2026-08-13T02:16:28.013468Z","submitted_at":"2024-11-23T15:07:15Z","title":"TKG-DM: Training-free Chroma Key Content Generation Diffusion Model","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:11:24.769603Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2411.15580"},"observation_digest":"sha256:6b655d7c6079f31eb0b2d0fd97041329b39cd99fb26169e1f47c019fa620fe2b","observation_id":"6d21bf6e-5cf2-4b86-9c45-cdab03e1e740","resolution":{"observed_at":"2026-08-12T14:11:24.769603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-12T14:03:29.589917Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15706","last_updated":"2024-11-24T04:21:51Z","snapshot_observed_at":"2026-08-20T12:42:07.783666Z","submitted_at":"2024-11-24T04:21:51Z","title":"Fixing the Perspective: A Critical Examination of Zero-1-to-3","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T14:03:29.589917Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2411.15706"},"observation_digest":"sha256:39a870a50a80e67d56fc977b7a51d75edc98fd1ba0907d5edfe4b97b39224229","observation_id":"a0b4777e-b87e-4c41-b900-79b32f5d28f2","resolution":{"observed_at":"2026-08-12T14:03:29.589917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-12T13:11:04.101757Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16443","last_updated":"2025-04-16T12:21:59Z","snapshot_observed_at":"2026-08-18T01:11:31.316132Z","submitted_at":"2024-11-25T14:46:17Z","title":"SplatFlow: Multi-View Rectified Flow Model for 3D Gaussian Splatting Synthesis","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T13:11:04.101757Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2411.16443"},"observation_digest":"sha256:ebf5d246267e73625c99dc7ac2887bbd03b62357fc45c47119df4067ca23464a","observation_id":"973c4af8-9b07-451e-9249-7833c3c5f017","resolution":{"observed_at":"2026-08-12T13:11:04.101757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-12T13:02:31.782084Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.16575","last_updated":"2025-07-08T20:15:01Z","snapshot_observed_at":"2026-08-19T11:18:14.567823Z","submitted_at":"2024-11-25T16:59:42Z","title":"Rethinking Diffusion for Text-Driven Human Motion Generation: Redundant Representations, Evaluation, and Masked Autoregression","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T13:02:31.782084Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2411.16575"},"observation_digest":"sha256:4e319cfc57c1de2d7e4a630381865f80308e5d4e058237b537d1cf049ee23b8a","observation_id":"9ed9c813-a683-4613-8795-9db04e5526cc","resolution":{"observed_at":"2026-08-12T13:02:31.782084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-12T14:24:43.368655Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.16720","last_updated":"2025-04-24T21:37:00Z","snapshot_observed_at":"2026-08-19T00:15:02.547227Z","submitted_at":"2024-11-23T02:01:49Z","title":"Importance-Based Token Merging for Efficient Image and Video Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:43.368655Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2411.16720"},"observation_digest":"sha256:7f549efe83374ade7ed488c950dd9188124ad01fb39d5ff9f7a1bd9662091240","observation_id":"9993ce31-1403-429d-bccc-304ebd6fd3c2","resolution":{"observed_at":"2026-08-12T14:24:43.368655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-12T12:10:27.210128Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17440","last_updated":"2025-03-25T23:08:48Z","snapshot_observed_at":"2026-08-15T17:17:11.643992Z","submitted_at":"2024-11-26T13:58:24Z","title":"Identity-Preserving Text-to-Video Generation by Frequency Decomposition","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T12:10:27.210128Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2411.17440"},"observation_digest":"sha256:0c73f1143b563b163c4fd7d942af310a17ad5d25ea892436de89b0db914c6b39","observation_id":"2a70c6db-af35-4834-8628-962d20f2c769","resolution":{"observed_at":"2026-08-12T12:10:27.210128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-12T12:42:49.195846Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17760","last_updated":"2024-11-26T00:44:37Z","snapshot_observed_at":"2026-08-20T19:29:13.125052Z","submitted_at":"2024-11-26T00:44:37Z","title":"Efficient Self-Improvement in Multimodal Large Language Models: A Model-Level Judge-Free Approach","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T12:42:49.195846Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2411.17760"},"observation_digest":"sha256:49ec801a145342632fc707955178b15594a7473877a882b8436c14ab9a32d330","observation_id":"a6a8cf59-d076-4253-8f86-fb6f5e809efa","resolution":{"observed_at":"2026-08-12T12:42:49.195846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-12T11:10:54.649484Z","title":"CLIPScore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18499","last_updated":"2025-03-30T07:22:46Z","snapshot_observed_at":"2026-08-17T14:00:00.020812Z","submitted_at":"2024-11-27T16:39:04Z","title":"OpenING: A Comprehensive Benchmark for Judging Open-ended Interleaved Image-Text Generation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T11:10:54.649484Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2411.18499"},"observation_digest":"sha256:a213fd0a1d3d11d65c5e6b6025387d8e14ba18f608fda85e28aa722f24e418ec","observation_id":"ca23ed6b-ceb0-463d-8e9c-369d69745e03","resolution":{"observed_at":"2026-08-12T11:10:54.649484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-12T11:07:39.537545Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18673","last_updated":"2025-05-06T13:11:14Z","snapshot_observed_at":"2026-08-16T08:18:45.331169Z","submitted_at":"2024-11-27T18:49:13Z","title":"AC3D: Analyzing and Improving 3D Camera Control in Video Diffusion Transformers","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:39.537545Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2411.18673"},"observation_digest":"sha256:6980a92463acbd1d2dde419a9eec9abbe3a22fcccec5a19859fc8de81be2d9ac","observation_id":"78d9885c-a965-4c8f-9078-cea6b6fc1c2d","resolution":{"observed_at":"2026-08-12T11:07:39.537545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-12T10:35:48.024015Z","title":"Clipscore: A reference-free evaluation metric for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.19106","last_updated":"2025-01-08T04:11:48Z","snapshot_observed_at":"2026-08-16T22:06:55.597270Z","submitted_at":"2024-11-28T12:42:14Z","title":"Detailed Object Description with Controllable Dimensions","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T10:35:48.024015Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2411.19106"},"observation_digest":"sha256:7e21dde50724ef288c5a9d86589d0cce373b9b5f431387d90728169f9a24c8be","observation_id":"f3332ba3-5785-42de-b973-7e501621c279","resolution":{"observed_at":"2026-08-12T10:35:48.024015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-12T04:59:40.279550Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00857","last_updated":"2025-03-11T13:13:11Z","snapshot_observed_at":"2026-08-20T15:43:58.488424Z","submitted_at":"2024-12-01T15:45:26Z","title":"Coherent Video Inpainting Using Optical Flow-Guided Efficient Diffusion","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T04:59:40.279550Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.00857"},"observation_digest":"sha256:875aa63949bb69d8d8fe1ad884b26fbb00b44476afdda9c824757e5d70bc0cb5","observation_id":"91f88792-b290-4714-af5a-d86a7a17d77a","resolution":{"observed_at":"2026-08-12T04:59:40.279550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-12T04:39:36.730034Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01197","last_updated":"2024-12-03T03:16:54Z","snapshot_observed_at":"2026-08-16T11:02:07.102145Z","submitted_at":"2024-12-02T06:59:52Z","title":"InstantSwap: Fast Customized Concept Swapping across Sharp Shape Differences","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T04:39:36.730034Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.01197"},"observation_digest":"sha256:8f36240a7cef84739d01a6dfded45d3b761b653344223e2e55cb545784974161","observation_id":"da4da0bb-2b4d-4aed-b9e7-a712bd63288b","resolution":{"observed_at":"2026-08-12T04:39:36.730034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-12T04:31:05.728199Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01339","last_updated":"2024-12-05T18:43:25Z","snapshot_observed_at":"2026-08-18T02:32:40.991957Z","submitted_at":"2024-12-02T10:06:57Z","title":"Negative Token Merging: Image-based Adversarial Feature Guidance","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T04:31:05.728199Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.01339"},"observation_digest":"sha256:c037f486ef80182dd01e73f467d463c44b5f54735e203949340db9b2f5aa7740","observation_id":"b3be7236-a822-4a94-9e20-153206e705e0","resolution":{"observed_at":"2026-08-12T04:31:05.728199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-11T23:02:16.217583Z","title":"L.; and Choi, Y","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.02929","last_updated":"2025-02-22T05:58:21Z","snapshot_observed_at":"2026-08-14T05:17:41.334885Z","submitted_at":"2024-12-04T00:42:15Z","title":"Panoptic Diffusion Models: co-generation of images and segmentation maps","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T23:02:16.217583Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.02929"},"observation_digest":"sha256:1767bd8ca7aa88dbab492edc63066179692c815101b841049fa2c3d8bae0ff37","observation_id":"5a66836b-5dc7-4da0-8900-02125e3c1cad","resolution":{"observed_at":"2026-08-11T23:02:16.217583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-11T22:31:57.271243Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03400","last_updated":"2024-12-04T15:31:30Z","snapshot_observed_at":"2026-08-20T01:29:14.660074Z","submitted_at":"2024-12-04T15:31:30Z","title":"Implicit Priors Editing in Stable Diffusion via Targeted Token Adjustment","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T22:31:57.271243Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.03400"},"observation_digest":"sha256:d6a0c516ae756817f67a395275d4e8c9b6e35de37a67562a06ebc8c8742f9541","observation_id":"2dec5099-fff8-4e6b-9f98-9dca9e505334","resolution":{"observed_at":"2026-08-11T22:31:57.271243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":"2104.08718","doi":"10.48550/arxiv.2104.08718","metadata_source":"pith","pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","venue":"cs.CV","work_id":"2dd7e0b7-c69c-4976-a406-12d4f5b18d14","year":2021},"citing_paper":{"arxiv_id":"2412.04300","last_updated":"2025-06-04T03:29:18Z","snapshot_observed_at":"2026-08-15T01:57:23.693588Z","submitted_at":"2024-12-05T16:21:01Z","title":"T2I-FactualBench: Benchmarking the Factuality of Text-to-Image Models with Knowledge-Intensive Concepts","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-23T08:00:12.781392Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.04300"},"observation_digest":"sha256:14387c621ca56020f6e36a95f2bb4a10823852469ae05d18aa935a4331cc213f","observation_id":"dcd4ba30-9b3e-4100-a6a1-cc5ce2a7aad3","resolution":{"observed_at":"2026-05-23T08:02:43.247094Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-11T21:29:40.166136Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04462","last_updated":"2024-12-05T18:59:41Z","snapshot_observed_at":"2026-08-16T13:03:27.743921Z","submitted_at":"2024-12-05T18:59:41Z","title":"4Real-Video: Learning Generalizable Photo-Realistic 4D Video Diffusion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:40.166136Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.04462"},"observation_digest":"sha256:d3590cf4bed68ca82f9de85a02c4a7be634608e76be8dd52b31ede51648dcfc8","observation_id":"5a20d4bc-0058-4304-b310-5d5308306958","resolution":{"observed_at":"2026-08-11T21:29:40.166136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-11T21:08:28.715893Z","title":"Clipscore: A reference-free evaluation metric for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05035","last_updated":"2024-12-06T13:39:36Z","snapshot_observed_at":"2026-08-21T13:06:21.483133Z","submitted_at":"2024-12-06T13:39:36Z","title":"SMIC: Semantic Multi-Item Compression based on CLIP dictionary","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T21:08:28.715893Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.05035"},"observation_digest":"sha256:b990d5ce9fba4c8d8b4130670a4b57d021c255db7c838b57e866976af7cb2693","observation_id":"f274b079-4e88-46d9-9792-f8317c9a1f9e","resolution":{"observed_at":"2026-08-11T21:08:28.715893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-11T20:28:49.268128Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05722","last_updated":"2024-12-07T18:44:38Z","snapshot_observed_at":"2026-08-16T21:49:48.017961Z","submitted_at":"2024-12-07T18:44:38Z","title":"Evaluating Hallucination in Text-to-Image Diffusion Models with Scene-Graph based Question-Answering Agent","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T20:28:49.268128Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.05722"},"observation_digest":"sha256:58e44cb6c4407795d3f4d539bd1c6d3edcb916344b6dcf5e7f649c25b961b84c","observation_id":"89e3bb8b-afe0-435b-b10d-7d7528d42cf9","resolution":{"observed_at":"2026-08-11T20:28:49.268128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-11T20:17:52.587933Z","title":"Hessel, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05899","last_updated":"2024-12-08T11:36:32Z","snapshot_observed_at":"2026-08-14T20:30:41.597939Z","submitted_at":"2024-12-08T11:36:32Z","title":"Accelerating Video Diffusion Models via Distribution Matching","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T20:17:52.587933Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.05899"},"observation_digest":"sha256:b3a69d29ef19458173240f04f6e6c8405a219467da35c564c1cfe28b05c0319a","observation_id":"99b70d1f-08b6-4f48-9473-b1957323020d","resolution":{"observed_at":"2026-08-11T20:17:52.587933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-11T19:30:02.621733Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06661","last_updated":"2025-05-07T16:57:47Z","snapshot_observed_at":"2026-08-13T15:15:11.527451Z","submitted_at":"2024-12-09T17:00:20Z","title":"Efficiency Meets Fidelity: A Novel Quantization Framework for Stable Diffusion","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T19:30:02.621733Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.06661"},"observation_digest":"sha256:446e985237cc0bb7b477704076ad8219d5cf1af471922c95f6a0da02dbc3d440","observation_id":"fc00d293-5500-4efa-807c-b35ba306e72f","resolution":{"observed_at":"2026-08-11T19:30:02.621733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-11T19:32:44.241948Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06875","last_updated":"2024-12-09T16:17:22Z","snapshot_observed_at":"2026-08-16T10:16:47.085316Z","submitted_at":"2024-12-09T16:17:22Z","title":"VQ4ALL: Efficient Neural Network Representation via a Universal Codebook","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T19:32:44.241948Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.06875"},"observation_digest":"sha256:7efeede72c2c161a2ba65340c4d5275066416d75db226a52d0de888a1259779c","observation_id":"081dbb8d-9b5c-47a5-8233-7bf0f3baa3d3","resolution":{"observed_at":"2026-08-11T19:32:44.241948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-11T16:55:34.957349Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09618","last_updated":"2024-12-12T18:59:48Z","snapshot_observed_at":"2026-08-13T01:30:47.696305Z","submitted_at":"2024-12-12T18:59:48Z","title":"EasyRef: Omni-Generalized Group Image Reference for Diffusion Models via Multimodal LLM","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T16:55:34.957349Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.09618"},"observation_digest":"sha256:633bf5edfc2c603cfe3ea8959d9444588454483b0fbc2a319d78a800f3e409e4","observation_id":"8f90f2ce-d1e7-4ccc-bae1-4d542491105f","resolution":{"observed_at":"2026-08-11T16:55:34.957349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-11T18:35:56.217500Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09645","last_updated":"2025-08-20T18:39:27Z","snapshot_observed_at":"2026-08-21T02:24:59.963622Z","submitted_at":"2024-12-10T18:52:39Z","title":"Evaluation Agent: Efficient and Promptable Evaluation Framework for Visual Generative Models","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T18:35:56.217500Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.09645"},"observation_digest":"sha256:49cc65dc975897d506daf01ecaed8ca6ef5a7535e1c82d5ba9a60f2173cf3dbf","observation_id":"bb87cab8-5793-4fbb-a903-6b74ee1889e1","resolution":{"observed_at":"2026-08-11T18:35:56.217500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-11T17:33:18.113893Z","title":"Clip- score: A reference-free evaluation metric for image captio ning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.09656","last_updated":"2024-12-12T02:09:04Z","snapshot_observed_at":"2026-08-13T07:23:49.890621Z","submitted_at":"2024-12-12T02:09:04Z","title":"From Noise to Nuance: Advances in Deep Generative Image Models","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-11T17:33:18.113893Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.09656"},"observation_digest":"sha256:c746877922fad93a2480099916edb251f3a2f16edfdc5406f17e292c5ee4e639","observation_id":"fad934c5-e930-4db5-807e-2c851cf30bb2","resolution":{"observed_at":"2026-08-11T17:33:18.113893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-11T15:50:16.694077Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10604","last_updated":"2024-12-18T17:49:32Z","snapshot_observed_at":"2026-08-18T04:13:34.486226Z","submitted_at":"2024-12-13T23:15:35Z","title":"EvalGIM: A Library for Evaluating Generative Image Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T15:50:16.694077Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.10604"},"observation_digest":"sha256:e03d728e9405462355f82f571792d96e3cbce709aed95f21e741d7e4be4a09dc","observation_id":"13e28ae0-bedb-464e-9baf-0f9e5cfc72c9","resolution":{"observed_at":"2026-08-11T15:50:16.694077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-11T14:55:03.398547Z","title":"L.; and Choi, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11549","last_updated":"2024-12-16T08:31:55Z","snapshot_observed_at":"2026-08-19T14:35:20.629365Z","submitted_at":"2024-12-16T08:31:55Z","title":"MPQ-DM: Mixed Precision Quantization for Extremely Low Bit Diffusion Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T14:55:03.398547Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.11549"},"observation_digest":"sha256:e1142d0ae87cbf87ba532fa6e13eb7f3d271c51e30606c0c4f1991705ccd5a70","observation_id":"403a2f60-9356-47f5-8bff-b8c583ffcf08","resolution":{"observed_at":"2026-08-11T14:55:03.398547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-11T14:39:28.412096Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11767","last_updated":"2024-12-16T13:39:32Z","snapshot_observed_at":"2026-08-18T22:47:43.208620Z","submitted_at":"2024-12-16T13:39:32Z","title":"IDEA-Bench: How Far are Generative Models from Professional Designing?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T14:39:28.412096Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.11767"},"observation_digest":"sha256:5fa1a6c0e297bcc24af7bb2b62a0e6fe7742e5e36432de6334cddca76568de13","observation_id":"f390ce22-6bed-422e-be3c-fa1d7294c920","resolution":{"observed_at":"2026-08-11T14:39:28.412096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-11T13:28:09.237758Z","title":"Clipscore: A reference-free evaluation metric for image captioning.arXiv preprint arXiv:2104.08718, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.13155","last_updated":"2025-09-10T13:21:10Z","snapshot_observed_at":"2026-08-17T10:02:56.866170Z","submitted_at":"2024-12-17T18:28:48Z","title":"F-Bench: Rethinking Human Preference Evaluation Metrics for Benchmarking Face Generation, Customization, and Restoration","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T13:28:09.237758Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.13155"},"observation_digest":"sha256:703c0264c0912ce61946bac4f690635df964f86f5224eb97d75a723fd5b2cdd9","observation_id":"e674d951-f96c-4053-9cc5-eafd2b5d6599","resolution":{"observed_at":"2026-08-11T13:28:09.237758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-11T12:38:06.585700Z","title":"doi: 10.18653/v1/2023.eacl-main.38","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13989","last_updated":"2024-12-18T16:09:42Z","snapshot_observed_at":"2026-08-21T12:03:14.489092Z","submitted_at":"2024-12-18T16:09:42Z","title":"What makes a good metric? Evaluating automatic metrics for text-to-image consistency","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T12:38:06.585700Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.13989"},"observation_digest":"sha256:f7c44e2ed95dd5c1cc22212b4e4f1b7fe9b91d59a1dd25e59f19e6a2c6e19978","observation_id":"9d4c2484-9b1c-4e46-860b-7f4000518225","resolution":{"observed_at":"2026-08-11T12:38:06.585700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-11T12:08:56.985267Z","title":"Advances in Neural Information Processing Systems, 36","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.14628","last_updated":"2024-12-19T08:30:54Z","snapshot_observed_at":"2026-08-21T16:27:04.567428Z","submitted_at":"2024-12-19T08:30:54Z","title":"Qua$^2$SeDiMo: Quantifiable Quantization Sensitivity of Diffusion Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T12:08:56.985267Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.14628"},"observation_digest":"sha256:314d1b1ba4503c7143ff40d7e5d420c0e6b7abfecd10f8ad95dca480532a28b1","observation_id":"01634d74-18d5-4144-a81b-edbd31e8c690","resolution":{"observed_at":"2026-08-11T12:08:56.985267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-11T11:38:24.492578Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.492578Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:b6c33e9c229d53c248f27ef6682eaad2ffbb4dddce98bf1db478b12b11f1928a","observation_id":"7b8aa261-e2d8-4152-ac33-1e2a5d902e26","resolution":{"observed_at":"2026-08-11T11:38:24.492578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-11T11:15:21.562415Z","title":"L.; and Choi, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.15677","last_updated":"2024-12-20T08:47:07Z","snapshot_observed_at":"2026-08-20T02:57:16.895035Z","submitted_at":"2024-12-20T08:47:07Z","title":"AI-generated Image Quality Assessment in Visual Communication","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T11:15:21.562415Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.15677"},"observation_digest":"sha256:e44f66486f6bb5d8fef84e2a9add2d91303affcbd347bef486c3b6277995e3e1","observation_id":"55625150-af62-4484-92f5-ab19e5d6cede","resolution":{"observed_at":"2026-08-11T11:15:21.562415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-11T10:20:01.906647Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16778","last_updated":"2025-03-28T21:52:16Z","snapshot_observed_at":"2026-08-16T21:56:43.058161Z","submitted_at":"2024-12-21T21:22:01Z","title":"RoomPainter: View-Integrated Diffusion for Consistent Indoor Scene Texturing","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T10:20:01.906647Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.16778"},"observation_digest":"sha256:36d2d11054e24b40b71b3a6764b6e015ed1c0ed20908dc47ca56e40f624aeb24","observation_id":"85517e1e-e0de-4452-8679-06a192f6fcdb","resolution":{"observed_at":"2026-08-11T10:20:01.906647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-11T10:19:29.754665Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16822","last_updated":"2025-03-27T15:42:18Z","snapshot_observed_at":"2026-08-19T03:34:15.901695Z","submitted_at":"2024-12-22T02:04:17Z","title":"Layer- and Timestep-Adaptive Differentiable Token Compression Ratios for Efficient Diffusion Transformers","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T10:19:29.754665Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.16822"},"observation_digest":"sha256:848809e289679ff499eadcd3a12e9b536c0b8f679e6657689a91a05f4bcd41a8","observation_id":"b89da4e1-cee5-417d-860b-7992339cd277","resolution":{"observed_at":"2026-08-11T10:19:29.754665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-11T05:31:22.085565Z","title":"L.; and Choi, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17504","last_updated":"2024-12-24T03:21:40Z","snapshot_observed_at":"2026-08-17T17:15:48.305009Z","submitted_at":"2024-12-23T12:03:35Z","title":"An Evaluation Framework for Product Images Background Inpainting based on Human Feedback and Product Consistency","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T05:31:22.085565Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.17504"},"observation_digest":"sha256:a409f237d56001864644b0ca1e4c4fafbf435207bc9b78ceabbcfd0d7a97a7b7","observation_id":"12656bd5-42eb-4471-a910-4f244d20b284","resolution":{"observed_at":"2026-08-11T05:31:22.085565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-11T05:23:02.018442Z","title":"L.; and Choi, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17644","last_updated":"2025-01-18T11:08:25Z","snapshot_observed_at":"2026-08-18T11:03:05.231944Z","submitted_at":"2024-12-23T15:21:28Z","title":"DreamFit: Garment-Centric Human Generation via a Lightweight Anything-Dressing Encoder","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T05:23:02.018442Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.17644"},"observation_digest":"sha256:c21a7d737aec59c32560d529bafb7dc001bb011732fa48f00c0a844eeaf9875f","observation_id":"fa0fc338-22b0-408c-b9f8-647e095924d2","resolution":{"observed_at":"2026-08-11T05:23:02.018442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-11T05:02:20.937773Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18150","last_updated":"2024-12-25T15:00:36Z","snapshot_observed_at":"2026-08-19T18:58:04.469177Z","submitted_at":"2024-12-24T04:08:25Z","title":"EvalMuse-40K: A Reliable and Fine-Grained Benchmark with Comprehensive Human Annotations for Text-to-Image Generation Model Evaluation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T05:02:20.937773Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.18150"},"observation_digest":"sha256:659ac8dae1dc9c5c0e5b4b0c692e1c3bf78e0fd767c65918a769b947e1763945","observation_id":"3e78fa1f-f29e-411d-8a9e-907b01b74f5f","resolution":{"observed_at":"2026-08-11T05:02:20.937773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-10T23:07:40.665146Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.21117","last_updated":"2025-01-02T16:31:44Z","snapshot_observed_at":"2026-08-10T22:59:55.895832Z","submitted_at":"2024-12-30T17:44:23Z","title":"Prometheus: 3D-Aware Latent Diffusion Models for Feed-Forward Text-to-3D Scene Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T23:07:40.665146Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.21117"},"observation_digest":"sha256:30045be955c295bfab515d34660024051a2715ca09a9257e80a417b749b813fe","observation_id":"85b31173-2b77-4b1a-ba5b-757bb3aafe4a","resolution":{"observed_at":"2026-08-10T23:07:40.665146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-10T22:58:47.349319Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.00375","last_updated":"2024-12-31T09:56:40Z","snapshot_observed_at":"2026-08-12T14:26:38.597825Z","submitted_at":"2024-12-31T09:56:40Z","title":"Token Pruning for Caching Better: 9 Times Acceleration on Stable Diffusion for Free","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:58:47.349319Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2501.00375"},"observation_digest":"sha256:3cdc693d1b59e7bfce79ccd270f9217e4a44418ecd50a7312befdc83497473d2","observation_id":"7fa65f09-cb45-4233-87e4-b3fa8f2f6e29","resolution":{"observed_at":"2026-08-10T22:58:47.349319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-10T22:40:16.901571Z","title":"L.; and Choi, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01125","last_updated":"2025-01-02T07:47:34Z","snapshot_observed_at":"2026-08-19T14:15:30.116571Z","submitted_at":"2025-01-02T07:47:34Z","title":"DuMo: Dual Encoder Modulation Network for Precise Concept Erasure","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T22:40:16.901571Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2501.01125"},"observation_digest":"sha256:c2928f5af54bf8ecc7b7feefd247f8d724d623763c3ea69245c9764c23490a0c","observation_id":"c59ff120-976d-440b-9b2d-f20c27af89a0","resolution":{"observed_at":"2026-08-10T22:40:16.901571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-10T22:36:52.435441Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01197","last_updated":"2025-01-02T11:18:25Z","snapshot_observed_at":"2026-08-19T00:26:15.862885Z","submitted_at":"2025-01-02T11:18:25Z","title":"LayeringDiff: Layered Image Synthesis via Generation, then Disassembly with Generative Knowledge","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:36:52.435441Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2501.01197"},"observation_digest":"sha256:064c49907028bb0c3837f917f33a403b34aa45aedc5553bf0a2138de066e83b9","observation_id":"c8e13857-2b6d-4ada-8bd7-4d5323160ae2","resolution":{"observed_at":"2026-08-10T22:36:52.435441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-10T22:48:04.381769Z","title":"Clipscore: A reference-free evaluation metric for image captioning, 2022, Preprint: http://arxiv.org/abs/2104.08718 arXiv:2104.08718 [cs.CV]","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01998","last_updated":"2025-02-23T19:22:58Z","snapshot_observed_at":"2026-08-19T14:28:49.075412Z","submitted_at":"2025-01-01T04:52:18Z","title":"SmartSpatial: Enhancing the 3D Spatial Arrangement Capabilities of Stable Diffusion Models and Introducing a Novel 3D Spatial Evaluation Framework","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T22:48:04.381769Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2501.01998"},"observation_digest":"sha256:3475b9d2c40a23d5e203dbfc86c9a934834a6eb30c3a3ebccf72c415edcd190a","observation_id":"8454fbc8-ce6a-4a40-ac58-f5ca185537cd","resolution":{"observed_at":"2026-08-10T22:48:04.381769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-10T22:18:04.984909Z","title":"CLIPScore: A reference-free evaluation metric for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03183","last_updated":"2025-01-03T18:09:26Z","snapshot_observed_at":"2026-08-10T22:12:20.355101Z","submitted_at":"2025-01-03T18:09:26Z","title":"Classifier-Guided Captioning Across Modalities","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:18:04.984909Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2501.03183"},"observation_digest":"sha256:b68584099a6397541804c8e3c78e358da3846748115d7d749598645c3f5375d9","observation_id":"66cd22c9-e800-41f3-a1ed-9abfa0cb7167","resolution":{"observed_at":"2026-08-10T22:18:04.984909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-10T21:49:53.843484Z","title":"arXiv:2104.08718 [cs.CV] https://arxiv.org/abs/2104.08718 Jonathan Ho, Ajay Jain, and Pieter Abbeel","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.03847","last_updated":"2025-01-09T04:25:42Z","snapshot_observed_at":"2026-08-16T09:31:46.329467Z","submitted_at":"2025-01-07T15:01:58Z","title":"Diffusion as Shader: 3D-aware Video Diffusion for Versatile Video Generation Control","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T21:49:53.843484Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2501.03847"},"observation_digest":"sha256:5d9ea3feff35bb99526636f33814df508d570a69a922156f9982b0d39463003f","observation_id":"b6c86eeb-b999-445e-b885-19eff5ac9b67","resolution":{"observed_at":"2026-08-10T21:49:53.843484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-10T21:08:51.047494Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06173","last_updated":"2025-06-07T09:44:59Z","snapshot_observed_at":"2026-08-20T04:50:42.641013Z","submitted_at":"2025-01-10T18:52:11Z","title":"VideoAuteur: Towards Long Narrative Video Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:08:51.047494Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2501.06173"},"observation_digest":"sha256:5b60816f0dd8538c081387cf4c1b3f9559ea1fef19c090466d3e0a652eb820c6","observation_id":"b89200f5-dd79-47ba-9c8b-92d82f051df6","resolution":{"observed_at":"2026-08-10T21:08:51.047494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-10T21:04:56.744833Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06481","last_updated":"2025-01-11T08:16:30Z","snapshot_observed_at":"2026-08-20T12:40:26.136059Z","submitted_at":"2025-01-11T08:16:30Z","title":"Focus-N-Fix: Region-Aware Fine-Tuning for Text-to-Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:04:56.744833Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2501.06481"},"observation_digest":"sha256:5bd79dea09d1b14bfe6030b7bfc311829c69033193d5e213dcac7aa391cb1fa2","observation_id":"2a7855f2-1815-43bd-8827-35af4b2b6e37","resolution":{"observed_at":"2026-08-10T21:04:56.744833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-10T21:02:00.918445Z","title":"L.; Choi, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.06708","last_updated":"2026-05-25T22:00:48Z","snapshot_observed_at":"2026-08-17T03:31:02.136201Z","submitted_at":"2025-01-12T04:28:14Z","title":"Evaluating Sample Utility for Efficient Data Selection by Mimicking Model Weights","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:02:00.918445Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2501.06708"},"observation_digest":"sha256:3d84fc2d05c762bca8251f6d1c04092b38d21aff22f4c0cb08626ca7912403ea","observation_id":"dc6188b9-3f0f-42d2-85c4-b84a9f6dcd53","resolution":{"observed_at":"2026-08-10T21:02:00.918445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-10T20:52:46.093604Z","title":"Clipscore: A reference-free evaluation metric for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.07070","last_updated":"2025-01-13T05:48:32Z","snapshot_observed_at":"2026-08-15T04:09:52.450179Z","submitted_at":"2025-01-13T05:48:32Z","title":"Enhancing Image Generation Fidelity via Progressive Prompts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:52:46.093604Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2501.07070"},"observation_digest":"sha256:4ea4cfed3d851bf35ff08cc6a4c035048033572dfd1dc1a26bd055fc3fdbb9be","observation_id":"9b0e1f0f-340e-4cc8-8b22-381c6ac6b1de","resolution":{"observed_at":"2026-08-10T20:52:46.093604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-10T20:42:44.934181Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.07563","last_updated":"2025-01-13T18:53:08Z","snapshot_observed_at":"2026-08-18T01:23:57.142778Z","submitted_at":"2025-01-13T18:53:08Z","title":"Training-Free Motion-Guided Video Generation with Enhanced Temporal Consistency Using Motion Consistency Loss","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:44.934181Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2501.07563"},"observation_digest":"sha256:8a35666e42255c8652528ffc1b3c0c81d10d68bc12681e4a0f9961a589fdcbeb","observation_id":"c5b85286-0984-4567-9251-b8601762634e","resolution":{"observed_at":"2026-08-10T20:42:44.934181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-10T20:41:31.382775Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.07574","last_updated":"2025-01-13T18:59:20Z","snapshot_observed_at":"2026-08-15T07:12:42.448779Z","submitted_at":"2025-01-13T18:59:20Z","title":"UnCommon Objects in 3D","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:41:31.382775Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2501.07574"},"observation_digest":"sha256:7df2ab9ab566b773aaac62bd0b6d5bd1993fcbb1b06e8aea2c33146ebde0fa68","observation_id":"d9090d83-a17c-46a7-aee2-dd9c0b58fd1a","resolution":{"observed_at":"2026-08-10T20:41:31.382775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-10T20:01:25.372325Z","title":"CLIPscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09499","last_updated":"2025-01-16T12:20:40Z","snapshot_observed_at":"2026-08-15T14:13:42.140660Z","submitted_at":"2025-01-16T12:20:40Z","title":"VanGogh: A Unified Multimodal Diffusion-based Framework for Video Colorization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:01:25.372325Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2501.09499"},"observation_digest":"sha256:37b20a143d476f30f6224e4f550beef2150172453c59c7aae51572b869e78d14","observation_id":"f2ce9f71-bf9c-45eb-806e-117ed837ad2b","resolution":{"observed_at":"2026-08-10T20:01:25.372325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":"2104.08718","doi":"10.48550/arxiv.2104.08718","metadata_source":"pith","pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","venue":"cs.CV","work_id":"2dd7e0b7-c69c-4976-a406-12d4f5b18d14","year":2021},"citing_paper":{"arxiv_id":"2501.09732","last_updated":"2025-01-16T18:30:37Z","snapshot_observed_at":"2026-08-16T15:15:38.321253Z","submitted_at":"2025-01-16T18:30:37Z","title":"Inference-Time Scaling for Diffusion Models beyond Scaling Denoising Steps","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T11:45:17.473970Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2501.09732"},"observation_digest":"sha256:ece33e6d25e4ffcd1e111f24d26379f9d45ec2c91c93c7fc6baff6c1c49814e9","observation_id":"73f34d12-ed29-4c60-a14a-7c1a311c9656","resolution":{"observed_at":"2026-05-20T11:45:17.609637Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-10T19:44:31.656404Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.09815","last_updated":"2025-01-16T20:02:13Z","snapshot_observed_at":"2026-08-18T14:16:37.443992Z","submitted_at":"2025-01-16T20:02:13Z","title":"Lossy Compression with Pretrained Diffusion Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T19:44:31.656404Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2501.09815"},"observation_digest":"sha256:d01966983e1612aad404c48599439ab3deedc28300ffae4e5f7fa7d83b96c1f4","observation_id":"32bfdc11-20f1-462d-904d-3feae0a59488","resolution":{"observed_at":"2026-08-10T19:44:31.656404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-10T20:23:43.195897Z","title":"L.; and Choi, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.10462","last_updated":"2025-09-01T03:15:49Z","snapshot_observed_at":"2026-08-17T03:48:25.096637Z","submitted_at":"2025-01-15T11:33:34Z","title":"BloomScene: Lightweight Structured 3D Gaussian Splatting for Crossmodal Scene Generation","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T20:23:43.195897Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2501.10462"},"observation_digest":"sha256:17da0fcb23b82426908481cf7db0e52572f8d29b955cb85f81242879c3f935b5","observation_id":"93281ba0-8c0d-40c2-b312-60b6882736b3","resolution":{"observed_at":"2026-08-10T20:23:43.195897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-10T18:53:00.825801Z","title":"Clipscore: A reference-free evaluation metric for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.10928","last_updated":"2025-04-19T14:52:08Z","snapshot_observed_at":"2026-08-10T18:47:01.186615Z","submitted_at":"2025-01-19T03:19:47Z","title":"Generative Physical AI in Vision: A Survey","version":2},"reference_index":194,"source":"pdf_text","source_observed_at":"2026-08-10T18:53:00.825801Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2501.10928"},"observation_digest":"sha256:d0a02f6dcf6d0c165eb798afee75cf6686379e877c41920af62be9bf6ff4caee","observation_id":"a6f7f2cd-16a5-4cd9-8acf-73a5ae3eb335","resolution":{"observed_at":"2026-08-10T18:53:00.825801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-10T18:35:13.885166Z","title":"Clipscore: A reference-free evaluation metric for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.11211","last_updated":"2025-01-20T01:03:50Z","snapshot_observed_at":"2026-08-17T13:44:00.120667Z","submitted_at":"2025-01-20T01:03:50Z","title":"Ditto: Accelerating Diffusion Model via Temporal Value Similarity","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T18:35:13.885166Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2501.11211"},"observation_digest":"sha256:8c968c658bfba8ba029e8af9709608a558bc1f1bcfe792f035779659e6d0511f","observation_id":"46c64ec4-ab35-4d02-96b1-d7ef3065d8ca","resolution":{"observed_at":"2026-08-10T18:35:13.885166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-10T17:16:30.650330Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12393","last_updated":"2025-01-21T18:59:59Z","snapshot_observed_at":"2026-08-19T16:30:43.386492Z","submitted_at":"2025-01-21T18:59:59Z","title":"Towards Affordance-Aware Articulation Synthesis for Rigged Objects","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T17:16:30.650330Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2501.12393"},"observation_digest":"sha256:5544b96448ba4020da2625465e735523376a82b0119a63ae5e3482588ed5b2b9","observation_id":"95481e98-e255-4fd0-91b4-24087dd29f72","resolution":{"observed_at":"2026-08-10T17:16:30.650330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-10T16:41:28.766742Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.12910","last_updated":"2025-01-22T14:37:01Z","snapshot_observed_at":"2026-08-19T07:17:52.569204Z","submitted_at":"2025-01-22T14:37:01Z","title":"PreciseCam: Precise Camera Control for Text-to-Image Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T16:41:28.766742Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2501.12910"},"observation_digest":"sha256:fee3dbbf9e18ae0f30991df17588eb7e074dd5f150498a6e9ebb3549a0adb7d1","observation_id":"a56ee277-5a17-438f-97f0-9b9b8a7e1783","resolution":{"observed_at":"2026-08-10T16:41:28.766742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-09T19:05:52.878581Z","title":", Holtzman, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00433","last_updated":"2025-02-01T13:46:02Z","snapshot_observed_at":"2026-08-15T08:08:52.669892Z","submitted_at":"2025-02-01T13:46:02Z","title":"CAT Pruning: Cluster-Aware Token Pruning For Text-to-Image Diffusion Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T19:05:52.878581Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2502.00433"},"observation_digest":"sha256:168481a351b68eee74f0abcc052e063fd65d7e99356521b55c776e822eb0e970","observation_id":"55568b16-3cf2-461c-b26b-2e5673c4e097","resolution":{"observed_at":"2026-08-09T19:05:52.878581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-09T14:48:15.887654Z","title":"Clipscore: A reference- free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01639","last_updated":"2025-02-03T18:59:55Z","snapshot_observed_at":"2026-08-19T05:21:21.107320Z","submitted_at":"2025-02-03T18:59:55Z","title":"SliderSpace: Decomposing the Visual Capabilities of Diffusion Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T14:48:15.887654Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2502.01639"},"observation_digest":"sha256:1dc860256ea66229048af8b50d79eed2c598b9f93737376d0180a230d566f288","observation_id":"2b59a164-cdd1-4f7a-b359-2d427d5a683a","resolution":{"observed_at":"2026-08-09T14:48:15.887654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":"2104.08718","doi":"10.48550/arxiv.2104.08718","metadata_source":"pith","pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","venue":"cs.CV","work_id":"2dd7e0b7-c69c-4976-a406-12d4f5b18d14","year":2021},"citing_paper":{"arxiv_id":"2502.02452","last_updated":"2026-04-28T16:36:23Z","snapshot_observed_at":"2026-08-20T08:01:55.169145Z","submitted_at":"2025-02-04T16:19:20Z","title":"Personalization Toolkit: Training Free Personalization of Large Vision Language Models","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-23T03:33:13.549114Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2502.02452"},"observation_digest":"sha256:ee28d416a0fd33a6c56f9c14d009f62c45bd3aad706c9a5252c26eba9baa0255","observation_id":"5996a509-aff8-4269-9cff-15eeef87b8e1","resolution":{"observed_at":"2026-05-23T03:35:21.096364Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-08T21:03:23.625311Z","title":"Clipscore: A reference-free evaluation metric for image captioning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04923","last_updated":"2025-02-07T13:41:51Z","snapshot_observed_at":"2026-08-18T23:29:05.998388Z","submitted_at":"2025-02-07T13:41:51Z","title":"Cached Multi-Lora Composition for Multi-Concept Image Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T21:03:23.625311Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2502.04923"},"observation_digest":"sha256:3341fc1fc8d3511d167cb3c43003c91166a301e05cb820dda60bdbcc494eefe6","observation_id":"cc1cf290-a9f7-489a-988b-cec3226d64d8","resolution":{"observed_at":"2026-08-08T21:03:23.625311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-08T20:12:29.439896Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05130","last_updated":"2025-07-29T07:31:59Z","snapshot_observed_at":"2026-08-21T07:59:48.661314Z","submitted_at":"2025-02-07T18:02:47Z","title":"Latent Swap Joint Diffusion for 2D Long-Form Latent Generation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T20:12:29.439896Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2502.05130"},"observation_digest":"sha256:1c1848f367cb876bb70cee72d4b20d6bb1e9d4be574f444d2dd15d598d19deed","observation_id":"551bf0d0-18a3-4a2f-905c-94e313ef85bf","resolution":{"observed_at":"2026-08-08T20:12:29.439896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-08T20:04:02.162100Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05178","last_updated":"2025-02-07T18:59:57Z","snapshot_observed_at":"2026-08-16T14:57:26.851711Z","submitted_at":"2025-02-07T18:59:57Z","title":"QLIP: Text-Aligned Visual Tokenization Unifies Auto-Regressive Multimodal Understanding and Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T20:04:02.162100Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2502.05178"},"observation_digest":"sha256:822f41e5ce2bc28e53a25c3b62b853377da6e8042c10f99bb4dc2886aecec837","observation_id":"69f1c8aa-6680-435a-b8b6-7313cc4c3e6c","resolution":{"observed_at":"2026-08-08T20:04:02.162100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-08T19:32:31.838794Z","title":"Clipscore: A reference-free evaluation metric for image captioning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05415","last_updated":"2025-05-18T14:59:21Z","snapshot_observed_at":"2026-08-19T23:42:35.575400Z","submitted_at":"2025-02-08T02:52:25Z","title":"UniCMs: A Unified Consistency Model For Efficient Multimodal Generation and Understanding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T19:32:31.838794Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2502.05415"},"observation_digest":"sha256:cfac204a1c407180fed7d715a68f74dd9070dca2fb889b68c8d86735e36028b9","observation_id":"e509b2e8-5a80-41aa-9ab3-49933a812192","resolution":{"observed_at":"2026-08-08T19:32:31.838794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-08T17:27:25.702324Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05924","last_updated":"2025-02-09T14:57:25Z","snapshot_observed_at":"2026-08-18T06:53:16.571240Z","submitted_at":"2025-02-09T14:57:25Z","title":"Multi-Branch Collaborative Learning Network for Video Quality Assessment in Industrial Video Search","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T17:27:25.702324Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2502.05924"},"observation_digest":"sha256:81af8d9216f91980fb2a6734ffdb736727bc8c7fb903bab7d89e6e6b4a5bce41","observation_id":"70389f01-526c-4385-b5b8-d86f92308e50","resolution":{"observed_at":"2026-08-08T17:27:25.702324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-07T20:58:43.261918Z","title":"L., and Choi, Y","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09611","last_updated":"2025-02-13T18:58:15Z","snapshot_observed_at":"2026-08-19T09:00:59.641905Z","submitted_at":"2025-02-13T18:58:15Z","title":"Designing a Conditional Prior Distribution for Flow-Based Generative Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T20:58:43.261918Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2502.09611"},"observation_digest":"sha256:7dab37c66b58e048508a2b03c77c18d36263af672df6932101708473fcb19078","observation_id":"3cc78b7c-5f58-42d2-80de-ed42776ec2c0","resolution":{"observed_at":"2026-08-07T20:58:43.261918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":"2104.08718","doi":"10.48550/arxiv.2104.08718","metadata_source":"pith","pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","venue":"cs.CV","work_id":"2dd7e0b7-c69c-4976-a406-12d4f5b18d14","year":2021},"citing_paper":{"arxiv_id":"2503.06223","last_updated":"2026-08-15T15:17:31Z","snapshot_observed_at":"2026-08-20T23:09:04.096750Z","submitted_at":"2025-03-08T13:51:40Z","title":"RedDiffuser: Auditing Multimodal Safety Failures in Vision-Language Models via Reinforced Diffusion","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-23T00:13:08.603115Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2503.06223"},"observation_digest":"sha256:3725e97740ee47ea036d819c6e87a6726dbbcf521a14eba3e460e5c267f3991b","observation_id":"6a9ac102-022e-43e7-8b28-b1d39944d59a","resolution":{"observed_at":"2026-05-23T00:15:14.865385Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":"2104.08718","doi":"10.48550/arxiv.2104.08718","metadata_source":"pith","pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","venue":"cs.CV","work_id":"2dd7e0b7-c69c-4976-a406-12d4f5b18d14","year":2021},"citing_paper":{"arxiv_id":"2503.07265","last_updated":"2026-06-02T17:11:50Z","snapshot_observed_at":"2026-08-16T12:51:32.079370Z","submitted_at":"2025-03-10T12:47:53Z","title":"WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T16:24:27.407376Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2503.07265"},"observation_digest":"sha256:5eac31d907cb1c6aa545a24e73dcbc6251bbea9ebf459573a4b2c921671c004f","observation_id":"3e762140-f152-44f4-8131-c35c40d05802","resolution":{"observed_at":"2026-05-15T16:24:27.599278Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":"2104.08718","doi":"10.48550/arxiv.2104.08718","metadata_source":"pith","pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","venue":"cs.CV","work_id":"2dd7e0b7-c69c-4976-a406-12d4f5b18d14","year":2021},"citing_paper":{"arxiv_id":"2503.07703","last_updated":"2025-03-10T17:58:33Z","snapshot_observed_at":"2026-08-19T23:30:02.968735Z","submitted_at":"2025-03-10T17:58:33Z","title":"Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T08:27:36.242416Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2503.07703"},"observation_digest":"sha256:e911887317733e1dfeadd61dcda82b78b691e88ffee0cb4a546a4b20d0b72d73","observation_id":"edfaaaaf-9361-4d84-8377-1242aad38520","resolution":{"observed_at":"2026-05-17T08:27:36.298549Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-16T12:40:26.477919Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12018","last_updated":"2025-04-16T12:21:49Z","snapshot_observed_at":"2026-08-18T10:41:09.205775Z","submitted_at":"2025-04-16T12:21:49Z","title":"Instruction-augmented Multimodal Alignment for Image-Text and Element Matching","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T12:40:26.477919Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2504.12018"},"observation_digest":"sha256:565ce17c398907d0180eb38826ace4487817ccd3fd121c34dbaab9f4f9f3dda5","observation_id":"0b509637-dc17-4219-ba9b-4f04119afc3d","resolution":{"observed_at":"2026-08-16T12:40:26.477919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-16T12:32:58.827034Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12574","last_updated":"2025-08-26T13:04:59Z","snapshot_observed_at":"2026-08-20T18:09:22.946557Z","submitted_at":"2025-04-17T01:44:57Z","title":"ForgetMe: Evaluating Selective Forgetting in Generative Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T12:32:58.827034Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2504.12574"},"observation_digest":"sha256:86139bf9cf5f152a17683f578fffbf66fabcdc76206efabc544c0a03484615e8","observation_id":"9a23e4a3-f108-4237-9ec9-f6816cb03c50","resolution":{"observed_at":"2026-08-16T12:32:58.827034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-16T12:26:38.443356Z","title":"Clipscore: A reference-free evaluation metric for image captioning.arXiv preprint arXiv:2104.08718, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12805","last_updated":"2025-09-14T08:24:18Z","snapshot_observed_at":"2026-08-18T14:44:10.688247Z","submitted_at":"2025-04-17T10:10:25Z","title":"Assessing LLMs in Art Contexts: Critique Generation and Theory of Mind Evaluation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T12:26:38.443356Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2504.12805"},"observation_digest":"sha256:0eb18a0c59cb386bb65a0c16a59df797d45046b85dfbaabd0660bfdab0ee38e5","observation_id":"e761297e-f7eb-4857-a665-eafa3ed02194","resolution":{"observed_at":"2026-08-16T12:26:38.443356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-16T12:11:32.550978Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.13490","last_updated":"2025-08-02T05:53:06Z","snapshot_observed_at":"2026-08-18T17:15:41.877474Z","submitted_at":"2025-04-18T05:59:01Z","title":"Early Timestep Zero-Shot Candidate Selection for Instruction-Guided Image Editing","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T12:11:32.550978Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2504.13490"},"observation_digest":"sha256:24be0bb28916811809f9e390a70d7d69656fc46a221af74427bdd05072633ba3","observation_id":"ac5fa924-be72-42b7-8c49-f9596aeb24e0","resolution":{"observed_at":"2026-08-16T12:11:32.550978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-16T11:31:56.364098Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15376","last_updated":"2025-08-29T09:26:15Z","snapshot_observed_at":"2026-08-17T19:28:53.623882Z","submitted_at":"2025-04-21T18:34:57Z","title":"Towards Understanding Camera Motions in Any Video","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:31:56.364098Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2504.15376"},"observation_digest":"sha256:3f5c4d94b9db7e072a440102e124de8c8d54f705b22ba0f912d0174469b1c154","observation_id":"d463f054-8252-4d31-8bdf-5061e46b5dde","resolution":{"observed_at":"2026-08-16T11:31:56.364098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-16T10:51:00.595461Z","title":"arXiv:2104.08718 [cs.CV] https://arxiv.org/abs/2104.08718","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17269","last_updated":"2025-07-01T14:10:46Z","snapshot_observed_at":"2026-08-22T08:36:00.203989Z","submitted_at":"2025-04-24T05:54:56Z","title":"Towards Generalized and Training-Free Text-Guided Semantic Manipulation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T10:51:00.595461Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2504.17269"},"observation_digest":"sha256:35afcc5a4a49bd4ab1ae68cfa85851ebb0482dd675e8ca204d363144d5be3540","observation_id":"cf1244dc-bb41-421a-9079-099772494e4b","resolution":{"observed_at":"2026-08-16T10:51:00.595461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-16T10:35:43.563496Z","title":"Clipscore: A reference-free evaluation metric for image captioning.arXiv preprint arXiv:2104.08718,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17789","last_updated":"2025-04-27T23:01:22Z","snapshot_observed_at":"2026-08-19T03:52:56.793330Z","submitted_at":"2025-04-24T17:59:56Z","title":"Token-Shuffle: Towards High-Resolution Image Generation with Autoregressive Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T10:35:43.563496Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2504.17789"},"observation_digest":"sha256:b0149f7c4c31c8d6308ba77edfb6d6b24c1045b1562b888217eaabba16eb6fba","observation_id":"54348ea7-d209-443f-a712-16d66901f4ce","resolution":{"observed_at":"2026-08-16T10:35:43.563496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-16T11:08:11.435031Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17815","last_updated":"2025-04-23T06:21:11Z","snapshot_observed_at":"2026-08-18T09:21:02.459198Z","submitted_at":"2025-04-23T06:21:11Z","title":"Visibility-Uncertainty-guided 3D Gaussian Inpainting via Scene Conceptional Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:08:11.435031Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2504.17815"},"observation_digest":"sha256:ddf7871ca177d1c17a18a249b51ded49606a5015519cafe749ff4315173f24d8","observation_id":"83b379c4-275b-44d0-9b40-0dc61a9ab2a0","resolution":{"observed_at":"2026-08-16T11:08:11.435031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-16T10:27:13.220308Z","title":"arXiv:2104.08718 [cs.CV] https://arxiv.org/abs/2104.08718","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18204","last_updated":"2025-04-25T09:35:02Z","snapshot_observed_at":"2026-08-18T14:16:32.466268Z","submitted_at":"2025-04-25T09:35:02Z","title":"Optimizing Multi-Round Enhanced Training in Diffusion Models for Improved Preference Understanding","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T10:27:13.220308Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2504.18204"},"observation_digest":"sha256:86a5f6314c05a9afc40065841a60a3114137be27a47d4ed2358ce36edccc59e4","observation_id":"c1c2cee1-d19a-4beb-8c78-28ef151615da","resolution":{"observed_at":"2026-08-16T10:27:13.220308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-16T05:29:56.860744Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.20648","last_updated":"2025-04-29T11:18:38Z","snapshot_observed_at":"2026-08-21T14:12:20.969923Z","submitted_at":"2025-04-29T11:18:38Z","title":"SpaRE: Enhancing Spatial Reasoning in Vision-Language Models with Synthetic Data","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T05:29:56.860744Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2504.20648"},"observation_digest":"sha256:192e76c1e661563f119f5d28c6b7e79ccfda95727dedff4ea8907b6e2579b8ce","observation_id":"86914848-7193-435e-b39c-e8402835e93c","resolution":{"observed_at":"2026-08-16T05:29:56.860744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-16T05:11:56.048221Z","title":"Clipscore: A reference-free evaluation metric for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.21231","last_updated":"2025-04-29T23:46:21Z","snapshot_observed_at":"2026-08-20T08:30:08.829093Z","submitted_at":"2025-04-29T23:46:21Z","title":"T2ID-CAS: Diffusion Model and Class Aware Sampling to Mitigate Class Imbalance in Neck Ultrasound Anatomical Landmark Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T05:11:56.048221Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2504.21231"},"observation_digest":"sha256:0a1298e3009047341b627600eeb15e73dca4c850625cae527c2c881be93fcea1","observation_id":"47b93b4f-5dec-4171-b6c6-10a9d02e1a05","resolution":{"observed_at":"2026-08-16T05:11:56.048221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-16T05:13:54.743980Z","title":"Clipscore: A reference- free evaluation metric for image captioning.ArXiv, abs/2104.08718, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.21307","last_updated":"2026-08-19T07:09:22Z","snapshot_observed_at":"2026-08-22T21:09:02.258716Z","submitted_at":"2025-04-30T04:33:43Z","title":"The Linear Geometry of Interpretable Tokens: Jailbreaking Attacks and Defenses for Unlearned Diffusion Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T05:13:54.743980Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2504.21307"},"observation_digest":"sha256:17cbaa1847e67642493337d2fd09decefd3d50801f06ea6026eac30a57db35f9","observation_id":"21e96287-aadd-48dd-b60f-a2dbf248facc","resolution":{"observed_at":"2026-08-16T05:13:54.743980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-16T04:43:11.251340Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00759","last_updated":"2025-05-12T20:46:35Z","snapshot_observed_at":"2026-08-16T09:38:06.751547Z","submitted_at":"2025-05-01T17:47:55Z","title":"Multi-Modal Language Models as Text-to-Image Model Evaluators","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T04:43:11.251340Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2505.00759"},"observation_digest":"sha256:657a67c1390430779c5198ebad764b79fa2ba7137b9659c4837c9c15bd32fd57","observation_id":"463009d0-053e-4f5e-810b-18e192e0e015","resolution":{"observed_at":"2026-08-16T04:43:11.251340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2104.08718/citation-record","integrity":"/paper/2104.08718/integrity","json":"/paper/2104.08718/citation-record.json","paper":"/paper/2104.08718"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1511.03292","last_updated":"2015-11-10T21:14:51Z","snapshot_observed_at":"2026-08-15T08:14:16.255380Z","submitted_at":"2015-11-10T21:14:51Z","title":"From Images to Sentences through Scene Description Graphs using Commonsense Reasoning and Knowledge","version":1},"cited_work":{"arxiv_id":"1511.03292","doi":null,"metadata_source":"pith","pith_arxiv_id":"1511.03292","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From Images to Sentences through Scene Description Graphs using Commonsense Reasoning and Knowledge","venue":"cs.CV","work_id":"dd4c908a-9217-463d-852e-1034998769f6","year":2015},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"cited_paper":"/paper/1511.03292","citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:79f7167a1db38af9164635d1d1d394f881600cd643cca8ff38f34edde69f6ed2","observation_id":"fa2b55af-1263-47cb-9374-68b6cad6edf8","resolution":{"observed_at":"2026-05-12T22:24:10.085553Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.02818","last_updated":"2021-08-05T19:05:57Z","snapshot_observed_at":"2026-08-16T18:04:57.242101Z","submitted_at":"2021-08-05T19:05:57Z","title":"Evaluating CLIP: Towards Characterization of Broader Capabilities and Downstream Implications","version":1},"cited_work":{"arxiv_id":"2108.02818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.02818","snapshot_observed_at":"2026-07-04T02:49:24.782109Z","title":"Evaluating clip: towards characterization of broader capabilities and downstream implications.arXiv preprint arXiv:2108.02818","venue":null,"work_id":"7161697e-26f5-4f20-b765-eaa45dfbbc04","year":2021},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"cited_paper":"/paper/2108.02818","citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:9c021aaba503f4dde01c5f6f43d251cecccd248dc931abadd0764117af166012","observation_id":"c41121ab-e8dc-4a04-8546-051b9a7c9493","resolution":{"observed_at":"2026-05-12T22:24:10.077645Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0ea2ce8e-367d-446e-a1e5-00dc7c7a43a8","year":2016},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:09ea846ec9345f745330ac48f16d3453d32903363a4112f1c80e7f71d02dafc5","observation_id":"f347480d-02d6-4562-8b35-8cf5257b80cc","resolution":{"observed_at":"2026-05-12T22:24:10.306649Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"04b2b247-a772-418c-b7dc-0ec31f152fff","year":2019},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:df5a59c7862a1b258b6b99b05823df6d169a509edb9e85d92e5fcd05848a3279","observation_id":"af3d7e7c-1394-4191-b0de-14b8d51e80a8","resolution":{"observed_at":"2026-05-12T22:24:10.309556Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"41abb198-7a92-44c0-80ee-e7010f8bb6e1","year":2005},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:b06239f24ca27c845ccabea97785ae3b679c4bd9de3d91513a79046de0e5026c","observation_id":"c164624e-4703-4850-889e-c95eae017a7c","resolution":{"observed_at":"2026-05-12T22:24:10.312219Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Berg, Tamara L","venue":null,"work_id":"9ac7982a-43e5-4123-838b-7a74b9f82d1e","year":2012},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:90d08ec3467d8105faf423d744e844a60fabcbb360149f9d5d43e5f95df67dfe","observation_id":"afe4c153-0f3b-492e-b9e9-ae74471a1489","resolution":{"observed_at":"2026-05-12T22:24:10.089342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6cf47a74-8940-4fca-9146-44672af9fbf8","year":2019},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:dd950cf765ba60a7ee880e2c7fff608f727f7d9ef5f0ba64c863787daacc2d78","observation_id":"33fd4015-b67f-4b2d-befe-deff18a22327","resolution":{"observed_at":"2026-05-12T22:24:10.096344Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dc12ed11-b891-41a7-b747-80e3c1011d38","year":2004},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:2388a215ce9138e4c9c2d8853fc094ed8af3a3780a11fe0f8cdd31f8d080f9d9","observation_id":"2e08ade0-5347-449f-9eaa-d3af65a6e036","resolution":{"observed_at":"2026-05-12T22:24:10.101086Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"95b49ca0-fe06-439a-822f-db14ad1c2474","year":2020},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:202427687721908cdfe0caea133b196e362b904d52e98ffa56bebedb18641ca7","observation_id":"1613d89b-8367-4624-a05f-650bc3d0f406","resolution":{"observed_at":"2026-05-12T22:24:10.104823Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"723f8b1a-457b-40e6-803b-a97ea1b27b09","year":2018},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:feb26a94139efd826dda54bfdfe49abde0edd95cf627fd24fe930cea89ab5b38","observation_id":"98f7989f-6881-4545-afda-d2183a0f1bdd","resolution":{"observed_at":"2026-05-12T22:24:10.109699Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"177f0a28-d0f7-432e-b6bc-4684e37aaa38","year":2017},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:c3528533bc59e361fbf471269b50614755aa8108e843abfce300e5f9b4c77812","observation_id":"a5fddaa8-5ade-4b9b-a3db-ba01fdf164d7","resolution":{"observed_at":"2026-05-12T22:24:10.113335Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f389eac1-abc2-4989-b4ea-56f44363ffea","year":2019},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:49a7bdc61eaaf5c484910f00d2cfba93c6b52c6d96ca1e7c940af3cc85ca8a98","observation_id":"a257dcd9-dbf9-4a31-a86e-a49b138ed50e","resolution":{"observed_at":"2026-05-12T22:24:10.120623Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7dbac8ff-99b4-4830-bc09-d7f97c6cc754","year":2021},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:3564554d1a16baccd13e2d1c5a68955221835d6060530b8eeb3914ad59a35846","observation_id":"b99d14c0-a96e-44cb-ab75-88dbf4a7ef18","resolution":{"observed_at":"2026-05-12T22:24:10.123917Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"202c4759-ad89-481f-ae87-3714ff691d37","year":2014},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:1250bff72c4226503d8203a44c2ce1b72c64ebfc4924f6512307efa7a5ea27e7","observation_id":"f62eda7c-16ad-481d-abf3-557e5f5ccedf","resolution":{"observed_at":"2026-05-12T22:24:10.127525Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d22c2105-7126-42f4-be3a-53c5dfa8de26","year":2019},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:b59162ae481573dcd0f161b9447cd93bded9b4e2bddcb1d4f196ceef3c69a9ab","observation_id":"cb6290ae-83b3-448b-8104-1b4780f7d7e5","resolution":{"observed_at":"2026-05-12T22:24:10.130824Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f324da0e-7ff0-4ff1-bf4b-6aee00348032","year":2020},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:6039be5378f944f5aebc8722edf752c96e070ea794724b7f238dd7cc4ed8da12","observation_id":"5923138f-24f6-4174-a97b-300fb7c60498","resolution":{"observed_at":"2026-05-12T22:24:10.133758Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5b5bfbd2-a3fc-403d-a8be-246cea80dc0c","year":2018},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:62757e81a5479aaf109e62578fb262214691421e1c1b4d29ba924f1ca38e7f25","observation_id":"e7c6cbdd-a548-47b9-b81d-ad4e3e7bb7b7","resolution":{"observed_at":"2026-05-12T22:24:10.136570Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4f8c8c0c-4ecc-436f-ae1a-91b5741dee8b","year":2013},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:ee0291be3f4f4d09c5a3b2f92f585f45f510dcc1326531526e3008483caa431b","observation_id":"0dfebd7b-4c81-4653-85f3-9469c09ca3df","resolution":{"observed_at":"2026-05-12T22:24:10.139831Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b9c0e9d3-2525-4d00-8d0d-c9e238e072a1","year":2021},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:8db6fd39b2a95c8142827d7e0f87e813075cb57c3823b38a0ae7f7f2b5099fc9","observation_id":"317c9978-d3b5-4ce6-9c1a-c177ec4fbfce","resolution":{"observed_at":"2026-05-12T22:24:10.142874Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fc4d2708-84bb-47c9-9042-6f357b01e9af","year":2019},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:80caaba2cdc17e0b87dec8cfa60f3c339464106a56ee21ead755c14ab53dba43","observation_id":"9dc090a5-605e-409e-8ff7-b64fcbdaca47","resolution":{"observed_at":"2026-05-12T22:24:10.146140Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7370a323-d93c-4923-8161-27850a3dc0a1","year":2020},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:d4976aded908a7a99062d073f32e9caa0c0d6d689a7859d520722c80ed99b477","observation_id":"b16e1c5e-f2b0-47ea-9818-9d9d0266dfc0","resolution":{"observed_at":"2026-05-12T22:24:10.149065Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"af94d0a1-0453-4c39-8c13-5b452010f025","year":2020},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:2ab5fa3119d49c716b73adb9167d8b61710bbba61a124b456e7ce3f82002f442","observation_id":"699454aa-9a6e-46c7-be7b-5cf22726e296","resolution":{"observed_at":"2026-05-12T22:24:10.152251Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0ec132c0-b132-43f6-a5f3-d34bbe1d7d7c","year":2017},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:9602b7cd6a288a89599259a5f4807fd1e9994350cad856876e3ee6c765898f3f","observation_id":"d3022c46-ef8d-4417-98fe-0ff023181415","resolution":{"observed_at":"2026-05-12T22:24:10.155686Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6475631f-7e94-41ff-ad7e-c9a6c41d56ef","year":2021},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:02123447758da81946c29ecfad83ccf4ce4035f2422257bf0cbdbe283dc7d033","observation_id":"a9e966fc-1e5e-46c9-81d7-2a8748c105e8","resolution":{"observed_at":"2026-05-12T22:24:10.158823Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b9d00bcd-fc86-47d2-b6a1-4bb7c9b4e84d","year":2020},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:2da76abad4d57ca36565f487a4cf60b566f4a3d7614f092102d33dc4f4ac7622","observation_id":"8f590839-3e6f-43e2-9be1-66355986bc19","resolution":{"observed_at":"2026-05-12T22:24:10.161656Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"da505aff-5e6e-4cb1-9d2e-04cba63c663e","year":2018},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:47507c303e827acdd18373b285c910af489db5da3919f1dd58b3320b73fba834","observation_id":"fb69514e-2dd6-4e62-b0b3-8ae39de89d0e","resolution":{"observed_at":"2026-05-12T22:24:10.164759Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cc810e56-821f-4abc-9955-db8db3c87d9e","year":2004},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:55525c44d54e02545ea334143dc4267edcfd4e130451688debf2c169f7410de2","observation_id":"224940ed-aba3-4367-9e3f-3a485b44383e","resolution":{"observed_at":"2026-05-12T22:24:10.168045Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bbb8570c-b240-4f43-97e9-a0c275fba6ec","year":2014},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:430ceffebe8668cc20219f5c4a3e10f9713a9b95842d1f8b2a77358ff79371ef","observation_id":"43a9c085-bd92-4602-a96f-fecc40c98127","resolution":{"observed_at":"2026-05-12T22:24:10.170647Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"87c2d8dc-c177-47eb-af3b-3e1a3a64897b","year":2018},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:5b5ab4307fc651a4ac7da7c213301af6feb165ad3b2535c791f0f4538fce8c8e","observation_id":"2d96c658-f8cb-48b8-83fc-7f40536b119f","resolution":{"observed_at":"2026-05-12T22:24:10.175338Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4f79aae4-89a2-4e37-9bc1-5a80bcfcf284","year":2019},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:d189e95867da422d024b6a9a14685e238452d306627bb877c6f8e8a1adbcefb1","observation_id":"83bb5bf7-d7be-41c2-8e4a-69998d59c45b","resolution":{"observed_at":"2026-05-12T22:24:10.178741Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f5650679-50d5-4177-b1ab-ba6235368f7c","year":2013},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:6646bff730ef5ada9f125eb59e02fb25b90941d04a375ab5dda26b719295b9df","observation_id":"1e998835-462e-4e83-91d2-30bd7ef769b6","resolution":{"observed_at":"2026-05-12T22:24:10.181863Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bdf68720-ce2e-4588-93df-d1746d942179","year":2019},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:cccce221afec8ce224938cccca5f0d2e4462fb8015c5de74627eefb943a91245","observation_id":"f1c1a12f-5bbe-4286-af32-5f47cba0e6ee","resolution":{"observed_at":"2026-05-12T22:24:10.186624Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"75a0d314-4f22-4c58-9ace-76b4af8fcbbd","year":2020},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:8d31c7f92a278a3d2a9583ce15cbc935ead73cfd736be2bb77490fb320331b96","observation_id":"495fd5bd-a3f5-4032-9fab-84cedf540eb1","resolution":{"observed_at":"2026-05-12T22:24:10.190662Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.05893","last_updated":"2021-09-21T20:38:45Z","snapshot_observed_at":"2026-08-19T04:18:53.719948Z","submitted_at":"2021-04-13T01:53:26Z","title":"NewsCLIPpings: Automatic Generation of Out-of-Context Multimodal Media","version":2},"cited_work":{"arxiv_id":"2104.05893","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.05893","snapshot_observed_at":"2026-07-04T17:29:59.910240Z","title":"Newsclippings: Automatic generation of out-of-context multimodal media","venue":null,"work_id":"e423602d-b60f-4e3c-8b17-e0385a2cff77","year":2021},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"cited_paper":"/paper/2104.05893","citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:41ad445514c8ad5d797e7b00dc7079e3f894283e2cfeec9286eb8e9631c39dda","observation_id":"47010612-93d7-4b20-afbb-b3de5edcf56f","resolution":{"observed_at":"2026-05-12T22:24:10.057049Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d5e57665-c820-439c-bf17-e11497298ba2","year":2018},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:63d55b79aa318be158a603c9754501c5fa365cae226755c6e98c80cf4c18159d","observation_id":"4f979282-27af-447e-9f9e-954c4195e963","resolution":{"observed_at":"2026-05-12T22:24:10.193632Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e3d5aa06-5e76-4fd0-b422-d9fc0b1b99d2","year":2017},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:1edc4892c0b9e66c03c9f2f041a08dbf377067348ac51eab497b3bf7b5d0e13c","observation_id":"6c2187ed-3363-4f69-b72d-6bd336eb43b0","resolution":{"observed_at":"2026-05-12T22:24:10.196366Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8a864422-bc19-43a3-ac6a-0e859704ff17","year":2019},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:19046eca8f2924b787dd4e5f138bb0201e0f88a29daf9a692241a3e00c108105","observation_id":"3da62c7b-ee58-41e2-8031-1c91eb8ba3f1","resolution":{"observed_at":"2026-05-12T22:24:10.199241Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"db675446-89a9-4582-a1d8-d3910ef1cbb1","year":2012},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:6702b764cac395fd8cff88e902cb03978aea3279e41e6f2586dab800af7d87bd","observation_id":"2b130b63-41ca-4c25-990d-1e300a2f189e","resolution":{"observed_at":"2026-05-12T22:24:10.202280Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7c65a287-f35e-42ad-87da-6561efeffac0","year":2020},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:48740190d76bd713f3627a74cb9ba46f7be53df31779fbcdbc61f4280ace8454","observation_id":"6749f74c-1913-4575-ae29-1d165905bdb8","resolution":{"observed_at":"2026-05-12T22:24:10.206089Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b7604445-330c-41fd-aee0-6f249754da8e","year":2019},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:dca473229f45bf3c2268cbfac5a84cbde638a0892e1ffb0a1f0c73bab938464c","observation_id":"2b705e33-851d-4400-9d64-682dddb5d2a1","resolution":{"observed_at":"2026-05-12T22:24:10.209055Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":"1807.03748","doi":"10.1609/aaai.v36i10.21390","metadata_source":"pith","pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Learning with Contrastive Predictive Coding","venue":"cs.LG","work_id":"7b08a1d4-d565-424e-9c86-6ef244b7b90a","year":2018},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:be8bdcb7830345493ca3d4919934ac58c7251b6e68c3d627c9d608018ef5513d","observation_id":"a975f879-f6e3-4c4d-9b56-a859e534dde6","resolution":{"observed_at":"2026-05-12T22:24:10.065576Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"85e20f9c-d074-4f8e-8e1b-85cfa617eb85","year":2002},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:2b9b3d0cdb40dbc4985fe7a83e4337ba168dba97672df452cff05399a78b25ff","observation_id":"c7dd4918-155b-42f6-b8a3-3ef1a4ec1754","resolution":{"observed_at":"2026-05-12T22:24:10.211928Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pedregosa, G","venue":null,"work_id":"7233faa0-b6c2-44c0-9fb9-6ed164853e30","year":2011},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:1b87a839a892edd5ba172704068028ac3d794d7146ab961e036d151bd2b3f4e8","observation_id":"6eba61bc-46ce-49c3-90ff-02cfdb70454c","resolution":{"observed_at":"2026-05-12T22:24:10.214694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5b72d2c7-9f0b-4fc9-88a0-8b7c3c2a4a1c","year":2018},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:448ecb1ebae3b20b9a8ce32ff69158d3af431155795026ad950104892e1f0327","observation_id":"d2db4be9-cf6f-4521-bcdc-b6040f0cd577","resolution":{"observed_at":"2026-05-12T22:24:10.217212Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"565ab8bb-17c7-49c1-b06c-1c3792cfd3f4","year":2019},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:aaf844d3bae120bb132d7280c41920d03721be1c1c3572d9c845f2148a5f87fe","observation_id":"8c9823a8-bce3-4e43-b011-abf03cfa8f83","resolution":{"observed_at":"2026-05-12T22:24:10.219910Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f647f9fa-265e-4520-819a-214e06e7f5db","year":2021},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:4b68fef229870fb93ca7977fc173088672e7cd17d83ca35bd866b04e9a8e801a","observation_id":"a0580f6a-965a-4a32-9000-49190cbc2595","resolution":{"observed_at":"2026-05-12T22:24:10.223516Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"45da93ed-322c-42f4-8aad-4e3ab88f8b54","year":2019},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:d9c1405953232c7df685e57e5e23cb64559310ccfad3d132c038234504a8ff8c","observation_id":"8bc0379f-24d3-4fd2-a974-81ef1f4e16cd","resolution":{"observed_at":"2026-05-12T22:24:10.226824Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a4b6ea38-eccf-48b2-afdc-d0a9bb3104ea","year":2018},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:c65082acb67647bc1feae4afddcdef033a8be6fe70e6ac6d286b535d0a8e66fc","observation_id":"419688a5-e95f-4057-bc48-6376043e80d7","resolution":{"observed_at":"2026-05-12T22:24:10.232158Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"831e95b0-bb80-423b-9ecc-813cf7f0080f","year":2017},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:5a2d17cbf75200795d37edf08bb677f9df1cf98bd22b5bdc413e5adb3c66577b","observation_id":"d2a37ff3-0714-467e-8bfe-594ae1459c49","resolution":{"observed_at":"2026-05-12T22:24:10.235042Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4c987963-2315-4a1e-b40a-84ff67947bd5","year":2016},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:9b539e097e5e781531f24767c92bbe8e09d3a5102eeaac273509a34dfc8158e1","observation_id":"2d4b8e2d-927c-4467-aaf3-542c5b1ee8ab","resolution":{"observed_at":"2026-05-12T22:24:10.238893Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7d08f283-78da-4312-9581-123ec5cead3e","year":2017},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:e3ba345c508dbadbd36cc4d1d2076bd1d0a32034e32250fcb97b8062daf78dff","observation_id":"fe1ce84f-1fa0-4414-b868-de887125baff","resolution":{"observed_at":"2026-05-12T22:24:10.242059Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"81529e7f-a84a-4b71-aae4-30df04466b99","year":2019},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:172626acc97dfe7da235a45d1cf00576c39e3fe7c41fdcfd1aae1bc73cc397e7","observation_id":"55a8669a-141e-456d-a3a4-c43c8a4ebc32","resolution":{"observed_at":"2026-05-12T22:24:10.245362Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"eb80fe7b-b8b9-4593-9168-cc422c072d3e","year":2016},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:1b974493ce16ddf8e87e5edd06dff92e2babff889537739a0eb901ef64178715","observation_id":"2fae3b8d-0652-43be-a4ec-2949966957cf","resolution":{"observed_at":"2026-05-12T22:24:10.248400Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4ece70b8-22b5-4a3a-b28a-54843785f488","year":2010},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:f1a818229d72b3bbd21f05807d4beeb4c32084e24adf08ebdc6c225a34f6fd29","observation_id":"c1474b37-35c9-4f72-bf62-bce4724b3fe0","resolution":{"observed_at":"2026-05-12T22:24:10.251429Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9f9792f9-056e-453c-8516-ab630d0f66a0","year":2018},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:556253ea918eb39b6df798077b9faa3950730cd9f798e6d037cd5dc0d08f7949","observation_id":"b42995bf-468d-4b96-aca5-c55249b6d54e","resolution":{"observed_at":"2026-05-12T22:24:10.254478Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6d048548-8556-45c3-af9c-14bf01e0c579","year":2020},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:f8cce49aae168042ef6fe16498a41e7fd2ea6ad881b47559ebdbc5623994f437","observation_id":"90e25aa5-3b30-4c51-9544-fa1382a7ec2d","resolution":{"observed_at":"2026-05-12T22:24:10.257414Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dd155ba2-fe6c-4511-9320-51cfc20a821a","year":2019},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:4270428bced089ec1c17add7347a44ed03fdd2349188350774b581ca5e3a776f","observation_id":"eb603e34-1706-40d2-96d8-e06940aa1e19","resolution":{"observed_at":"2026-05-12T22:24:10.260758Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b9127a29-0f02-4e53-a055-4ad56248a6ad","year":2018},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:0e4d1d8b3f74f8f894daf2777f7da8d2509f814d3cfe24cc17efb5717f1f4c87","observation_id":"4f6e4e55-adb9-464a-a2d2-dbad775ec2a2","resolution":{"observed_at":"2026-05-12T22:24:10.264524Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b0d51edb-d0ff-4f23-9690-35fbc6b8c2c9","year":2017},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:92b74dde0f53c7b9819ab8370d7ea4f1f46c67ea47f9228ca7b66546bc124859","observation_id":"1fe12f83-9f98-4db7-9b27-f220d8d38e9b","resolution":{"observed_at":"2026-05-12T22:24:10.269077Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"eee91fb8-364f-4615-9595-380580939870","year":2015},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:f5dde24d52b37dbde7d73e19a88cd24537d3fe178cbadb7350b478f39f68c32a","observation_id":"5055f4a6-bdbe-485a-9e7c-227c345d9e74","resolution":{"observed_at":"2026-05-12T22:24:10.273879Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9250e66d-5339-4532-9cf3-398fb568ab2b","year":2016},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:3148cf99cd221ef01a25728482c43f8c291cfac56617901e2f8b340d405a3382","observation_id":"adf86c65-50eb-4bff-9d5b-31ceb5247ef6","resolution":{"observed_at":"2026-05-12T22:24:10.278325Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"08778a88-8054-435e-844c-21bacec40050","year":2021},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:dc072a6f76f718e2540a89b93eca3fbb2104d4aabc04492b744b0936158d1390","observation_id":"5a4647f5-9c7a-4ff1-8c25-96fb6f74f76f","resolution":{"observed_at":"2026-05-12T22:24:10.281088Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"63d950d8-e6d1-4fa7-863c-1439aa6e03b5","year":2019},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:505a9483a2bda14f9a6c2843438cac79f32831376f7a446e93d0307ae6c1e87c","observation_id":"99e3e973-7539-4a71-8b03-5c342169f154","resolution":{"observed_at":"2026-05-12T22:24:10.284047Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"def7aad9-62fe-446c-8601-a7657017a561","year":2019},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:56ecce097874b3ebc3058787731d91180e2a2ce4173b88c277cfc9f22fe4ee6c","observation_id":"dd25d85e-aff6-4567-a360-b648ac410e2d","resolution":{"observed_at":"2026-05-12T22:24:10.286927Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2a4cba32-0951-49f4-9092-cd9426b2066c","year":2020},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:674b1e8e3f8e8ae2c6ebab6fa428c15944600db7f212884900b518ca1b537b14","observation_id":"23a81fe2-c160-4079-a5cf-b58b3b037c73","resolution":{"observed_at":"2026-05-12T22:24:10.289838Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c973def3-bd44-4e34-bdcf-2e1b78355bb2","year":2014},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:1ee48b7c19ad0c213ef790d420bceb25bea98d88f47de71a8ef02930aafe147d","observation_id":"e4e013cd-0e10-4853-b555-d0715844ce2f","resolution":{"observed_at":"2026-05-12T22:24:10.292904Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"862ec777-03d8-46d7-92bc-548c71f9024e","year":2020},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:66e0c34535377e28beaff2cd2680d13c24e758235f9c89b87f3cbf904dbb05cf","observation_id":"36192231-ec0c-4f29-8dfd-8c7be6d8aab0","resolution":{"observed_at":"2026-05-12T22:24:10.296242Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"52d140e5-128c-42bd-8873-40d69fd7f74b","year":2020},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:14ea36425c9fd16e6256f4aeb0f418da59e5d05a9639501c31fd22641f4cc78c","observation_id":"40c52b4d-8f91-4d9a-8220-e9616a6782e5","resolution":{"observed_at":"2026-05-12T22:24:10.299158Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e9c0bd26-e826-4a30-8170-0b1069385c3c","year":2013},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:16a74d2313c9bfb160b243d87066ca125ad4f63aca1a2d70cf09a0518c16a8f7","observation_id":"204f37c4-ced2-438a-ad58-bad7a642b455","resolution":{"observed_at":"2026-05-12T22:24:10.301549Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b6c948e8-8025-47cc-85ed-c9cb5d850ee6","year":2020},"citing_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-12T22:24:10.018933Z"},"links":{"citing_paper":"/paper/2104.08718"},"observation_digest":"sha256:7db2a662fd7a65051336f072f87cce098f5e0fc5a33320ac52f0c1f805427417","observation_id":"63fe2543-e63b-4673-9f2f-86666c6074a7","resolution":{"observed_at":"2026-05-12T22:24:10.304162Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":64,"verified_exact":4,"verified_fuzzy":2},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 100 inbound Pith citation observations for arXiv:2104.08718."}