{"as_of":"2026-08-21T06:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0dec838bf61657e5e893fbd4e790ac523c4334cb32080b66c1b4ba7b6cc70aaa","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:15:57.460723Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.09155/citation-record","integrity":"/paper/2501.09155/integrity","json":"/paper/2501.09155/citation-record.json","paper":"/paper/2501.09155"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:58.242575Z","title":"Springer New York, New York, NY, 2008","venue":null,"work_id":"3708177a-8100-4532-8f55-85cbc8ec8cf9","year":2008},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.247270Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:74857c12fae2b9c6b85a2fed5411855a10f6a1182e11c47599a14b647a6847ff","observation_id":"65ebb3eb-4f73-4310-9b5b-8d357fb65d47","resolution":{"observed_at":"2026-08-10T20:15:58.247236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:58.226702Z","title":null,"venue":null,"work_id":"17da527a-010f-4352-b0d8-8f7f1b7892f4","year":2020},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.254697Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:a8cb8e30c8508f91792e77cd70a55486432c8e3c2fc05e1248e86aa98bed7cfc","observation_id":"5b4598df-9a43-4ffe-ab77-63c431e97c4a","resolution":{"observed_at":"2026-08-10T20:15:58.231343Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:58.210171Z","title":"Aditya, Y","venue":null,"work_id":"bb7431c4-9233-4a05-b73b-b3497d8a4fa0","year":2018},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.260749Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:4150f2237f24f456d008f019865116f0507d4cbdb5fe79c3c86156e71a4b140a","observation_id":"b3fa7de7-5b49-4dff-8a8b-3d8b58925a7f","resolution":{"observed_at":"2026-08-10T20:15:58.216537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:58.188627Z","title":"Anderson, B","venue":null,"work_id":"04ba2de7-b86d-455d-b4d3-6263bf5f48ad","year":2016},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.266727Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:383d61e8294fc26e156d962f6e67751e7613280196604fcf93fa20ecdf35ba6e","observation_id":"557d2f3c-7760-4969-879f-2403280692a4","resolution":{"observed_at":"2026-08-10T20:15:58.194350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:58.167079Z","title":"Aneja, A","venue":null,"work_id":"ce83fd0c-6eb8-4629-8e31-a96633c9ddf0","year":null},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.271352Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:5b5dded5e1d8ffd8cc9f9cf41583eb23ffc7edb4cf198e4b9c1c5a56245c148b","observation_id":"f1beebc2-8f8e-43ee-9d06-28f57e4153f8","resolution":{"observed_at":"2026-08-10T20:15:58.174182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:58.150953Z","title":"Carion, F","venue":null,"work_id":"e8e91e2d-6fcc-4985-aaaa-907387b7ad55","year":2020},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.276188Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:61c92406b71d6519b277b8b14a4d81d1a2160bd30aa0b6948579bd94c08a3ae0","observation_id":"9e8a0d37-c3d0-45ec-a70f-7333868b19dc","resolution":{"observed_at":"2026-08-10T20:15:58.156389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:58.133117Z","title":"Cornia, M","venue":null,"work_id":"6a021c76-e62c-4a55-823f-c58697fd9638","year":2020},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.281106Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:61d503484ddb87fe23f764dbd75eb6433f6830e6353407732b086870d6b43733","observation_id":"cc9a1d59-7d73-4d88-b85f-2ae53b22e3d1","resolution":{"observed_at":"2026-08-10T20:15:58.138784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:58.108900Z","title":null,"venue":null,"work_id":"fccd54f1-c622-4fdf-ab40-0bf6734eee30","year":2018},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.286019Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:e8a631d9990c8222df2ebe4ef3e18dbfbc5d58bf2cbba6eea6ddf6982a680590","observation_id":"2117796b-1b92-4efe-912f-c23573234fe0","resolution":{"observed_at":"2026-08-10T20:15:58.114738Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:58.090544Z","title":"Devlin, M","venue":null,"work_id":"d34a749a-8c4c-4cea-810a-73c9236fe19a","year":2019},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.290272Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:8288cfcb3f84c5af574b94af3e0e28b2f426447dc7cfe25cc61fde213652661b","observation_id":"4381c911-4e5c-4b39-9cb3-66db67b41973","resolution":{"observed_at":"2026-08-10T20:15:58.096576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:58.073791Z","title":null,"venue":null,"work_id":"57e716e3-7288-4157-ad7e-7d311aedcfb9","year":2004},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.294793Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:6bc6f98c0b3e0ddc5271adc2f74f5d189895a51ee0866fea9edb57f8eaec146d","observation_id":"5af8ffbc-1dd6-4f45-91a5-52879b9b5a47","resolution":{"observed_at":"2026-08-10T20:15:58.079781Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:58.059384Z","title":null,"venue":null,"work_id":"297fa56c-e775-460b-8e1a-d357d3539969","year":2001},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.299636Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:602e284bac6195d508bf2f757f207e807c91aa3f1f34e8657da102ecdcdbe944","observation_id":"a09aec31-3044-44f8-9856-7a63ad2b0507","resolution":{"observed_at":"2026-08-10T20:15:58.064380Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:58.037347Z","title":"Gonz´ alez-Ch´ avez, G","venue":null,"work_id":"5dc59225-85d0-4767-89be-6ba47f76479b","year":2024},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.304071Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:dc9bfd6ddef6347482676849faa1134c1b954c90386361f8c8ff103e68809733","observation_id":"47d7930b-3290-4e14-b065-b89416f9759b","resolution":{"observed_at":"2026-08-10T20:15:58.043912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:58.019573Z","title":null,"venue":null,"work_id":"d0e91286-9581-46f2-bfe8-5f7c5817e454","year":2021},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.309515Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:21598410e73730e9c3f9406329419019c207166f42848ca72337ad05ed34add7","observation_id":"dee7aec3-8330-41f7-bd85-cc5b9bde2d5f","resolution":{"observed_at":"2026-08-10T20:15:58.026461Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.998569Z","title":"Hodosh, P","venue":null,"work_id":"c1bf36f1-312f-4bec-b0d8-163125cc8364","year":2013},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.317543Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:d2df6efdf4ce0d81654c8663f7422dcfd4df3ce33c22a6d019212f99bb250a80","observation_id":"3c9d3916-7670-4853-8863-b649ab24e444","resolution":{"observed_at":"2026-08-10T20:15:58.005410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.978847Z","title":"Kasai, K","venue":null,"work_id":"e77635df-5fde-4b62-903a-be694df13f0e","year":2022},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.321804Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:6e587240ac5f0eaa66bf009ac14e2d96d27b6c3b57f52b5a1d88d6cf4a5dc564","observation_id":"9e50a53c-1121-4a36-a052-a3bbe84f2b33","resolution":{"observed_at":"2026-08-10T20:15:57.986157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.958172Z","title":null,"venue":null,"work_id":"c13cddc1-05a0-460f-ac7f-a09361b8e868","year":1948},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.326591Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:a1a3eff3ba729adfffc3fea7d3fbeb4817f4dce18f37f6493a6fa53b3b2af550","observation_id":"4d6ba391-c6c6-42d3-8cf6-9f49928df913","resolution":{"observed_at":"2026-08-10T20:15:57.963864Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.937980Z","title":null,"venue":null,"work_id":"be20cf06-aa6e-48cf-8062-c1b263556492","year":2021},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.331813Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:2a5f4e2cf1eb084709ee33b34df2c1953f22cbea46bb28df92c95289658c97cd","observation_id":"02f0908e-911d-4a3a-b821-dce02eb069c5","resolution":{"observed_at":"2026-08-10T20:15:57.945190Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.919735Z","title":"Krippendorff","venue":null,"work_id":"ce6ea15c-cc4a-4e53-bca2-d80b9334dfa8","year":2009},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.336628Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:3b2aa19032d8c8156c0cff72d6bfbacdb283b143be490ca83a6a567daf4b1444","observation_id":"b454c05e-481c-436c-bfe6-4df6c811887c","resolution":{"observed_at":"2026-08-10T20:15:57.925982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.901266Z","title":"Krippendorff","venue":null,"work_id":"a43578e7-db5c-45ed-b042-2a2a7cd2636e","year":2011},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.341156Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:b40b8bc42a0cc886a770e8f8de3f79cb08c705043f02e710e3d0e905cc9fe158","observation_id":"1649a973-3f22-4334-bb7d-a0ce0c26ca16","resolution":{"observed_at":"2026-08-10T20:15:57.907003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.880571Z","title":"Lavie and A","venue":null,"work_id":"dd73a01c-a46a-4bed-8f6c-35c514317542","year":2007},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.345662Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:3a728961dd031eaaba132d54372024ee8c9be5fb39d2fa018c9ad0f42012db6a","observation_id":"9088461f-61ed-44d1-aeca-929d35000d3c","resolution":{"observed_at":"2026-08-10T20:15:57.888941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.861165Z","title":"Levinboim, A","venue":null,"work_id":"cfd5e24d-e46f-43a3-9170-0c43873554be","year":2021},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.350160Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:47b50c008f2b124ddbd026fde41296f7052a51af454174eec832fb539f8a2d94","observation_id":"fb159076-4cea-4149-a0ba-e4b28b5ee87f","resolution":{"observed_at":"2026-08-10T20:15:57.867204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.355863Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.355863Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:421cde8df41307c873b927f827e39d14cb332bedb5815251534cdedb0be9050c","observation_id":"d1c3cae0-2169-4ec2-b920-b7a98d027277","resolution":{"observed_at":"2026-08-10T20:15:57.355863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.834028Z","title":null,"venue":null,"work_id":"568c904b-e782-46db-a52f-8fca43cd2761","year":2023},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.360682Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:214c660ddf44eeef3d3fa70c099e84b8627cbc1e38030e0975db4f584fe7c1f7","observation_id":"e9f5bffc-e62a-4565-9af0-516dd8fc398e","resolution":{"observed_at":"2026-08-10T20:15:57.838405Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.366327Z","title":null,"venue":null,"work_id":null,"year":1932},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.366327Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:8c71edb5c0dff1ec6b2174d39361acc920def4a1680f4d12b5ec369bbfaea079","observation_id":"772b51ef-5b30-4dba-b984-64907d6908b0","resolution":{"observed_at":"2026-08-10T20:15:57.366327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.801896Z","title":"Lin and F","venue":null,"work_id":"1d3c4c17-ee45-4267-993d-55c2e6fa90be","year":2004},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.370175Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:8233d79a0454297936939e67edee786e8771f3e046f00616ed2d586d96266f7d","observation_id":"6d3915eb-1b89-48bc-831a-440902a8c71f","resolution":{"observed_at":"2026-08-10T20:15:57.807380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.784823Z","title":null,"venue":null,"work_id":"b1395e1b-cd9c-4d0b-9e6b-4a9b41c7f177","year":2014},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.374598Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:cd882b0b0c31ff1a83381c89c73d4b5f90de313b87926a890d9f8b9d1bf80fac","observation_id":"1ba33e88-375d-47a0-99aa-fef0a018492f","resolution":{"observed_at":"2026-08-10T20:15:57.790960Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.762324Z","title":null,"venue":null,"work_id":"55269605-e3dc-4e61-a763-e640dffe27ae","year":2017},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.378590Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:86080ff50f5f9d8f826dd93bab28f825186db845d41f2f19ac24a650f0fb25be","observation_id":"4cde52b5-4ce0-4038-8096-d4bc2ac5d7eb","resolution":{"observed_at":"2026-08-10T20:15:57.767531Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.743912Z","title":"Moctezuma, T","venue":null,"work_id":"cf156940-4325-40b5-acfe-edc174aafc7e","year":2023},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.383350Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:a321a59e0b0977c973b330ceb005615c40c1d975fadbf0b2c6cf5e6023f2226f","observation_id":"9ddb9518-4557-4bc6-be62-adc6643d47c0","resolution":{"observed_at":"2026-08-10T20:15:57.749495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.726504Z","title":null,"venue":null,"work_id":"fd643a98-17f4-4163-ba4e-31e08bf9066f","year":2023},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.387863Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:1705781b0e86e4601c5e92b5fc6e91cf7cfa8dba483bc0364ce05dc28116383b","observation_id":"0d93616d-5668-47ef-b8fc-9cc047206a94","resolution":{"observed_at":"2026-08-10T20:15:57.733545Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.707140Z","title":null,"venue":null,"work_id":"807177b1-51f6-40d4-b574-88e304af4df4","year":1995},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.391993Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:32d1b5172df8415979d0c88fcb2b49a86995634510ef3cec33e0e3e650f42961","observation_id":"d7c165a0-03a1-4fe5-8b98-329c53af196c","resolution":{"observed_at":"2026-08-10T20:15:57.712620Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.691045Z","title":"Papineni, S","venue":null,"work_id":"39717039-42fe-4c5d-b424-99f551fdcd61","year":2002},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.396570Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:f8f58e650a7c41465e7d3260a374ff7943211413d73fe8310753c74e945afb89","observation_id":"3289be5b-6e5b-4b2d-b8db-e1d0a10bbb35","resolution":{"observed_at":"2026-08-10T20:15:57.696719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.677191Z","title":null,"venue":null,"work_id":"ee97ffc9-0c32-483d-b7eb-695620f71c13","year":2011},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.402073Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:d2e63e3df70dc1d0c926e971ce3ff2304edcfcaa96c20d20334ac4b6c6d08d0c","observation_id":"0ed91ce9-5d1b-4e2c-89a0-6be33c8a410b","resolution":{"observed_at":"2026-08-10T20:15:57.681779Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.406166Z","title":"Radford, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.406166Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:e0545bb38f7dcb37f474344d2ccdbabac21370e01c7826091f33218b15bbf66f","observation_id":"21ff81ff-e9e1-4fa6-808a-edf03c311a97","resolution":{"observed_at":"2026-08-10T20:15:57.406166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-10T20:15:57.410119Z","title":"Radford, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.410119Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:3ed45a314c0c3451b9d9f1d580abcd3d5e20d23ec8aa146188d9d96d8f51668b","observation_id":"9b705bf6-9c45-45ed-984d-87d7a3e151fb","resolution":{"observed_at":"2026-08-10T20:15:57.410119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.651606Z","title":"Rahman, N","venue":null,"work_id":"6ee8d845-8ce1-4779-a876-9d2c72bf6a9c","year":2019},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.414356Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:4fd84c4ac9eb149b6008eb989fd62b350a1a78e55f8057dc711070f03c3297fd","observation_id":"d65728e6-742e-4dcb-a59e-1ccab7b95f2a","resolution":{"observed_at":"2026-08-10T20:15:57.656746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.635501Z","title":"Schall, K","venue":null,"work_id":"aef7502a-8896-4402-9f0b-6dc2c01cf410","year":2024},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.419586Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:be787690f3d067b44f01cba54f2183c54ea2b99f5d8dc746f088602b240296a6","observation_id":"36ccfc71-6eb9-4787-b84c-524f62ca6e89","resolution":{"observed_at":"2026-08-10T20:15:57.640510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.620277Z","title":"Schuster, R","venue":null,"work_id":"c386901d-e70a-4a27-81d8-e179b05f5273","year":2015},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.423542Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:02e4520fe8df47273654009ef258f97daa91617cb23a1c3616dd3087541b8efa","observation_id":"fb540e5a-364b-48e9-bc70-483b70f8c72c","resolution":{"observed_at":"2026-08-10T20:15:57.625359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.605575Z","title":"Stanojevi´ c and K","venue":null,"work_id":"11584111-b20c-408e-851a-de4072475156","year":2014},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.427689Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:02405c4be5afbad3f1e5b5a67a344a11839257ee68d13aebd0588cc210b833e8","observation_id":"781df4f6-5772-4246-a79f-bb353f05f86a","resolution":{"observed_at":"2026-08-10T20:15:57.610281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.588777Z","title":"Vedantam, C","venue":null,"work_id":"830310c5-7d5b-446f-b1a6-855f67f429a0","year":2015},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.431952Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:8313b4155b7eab0df5789d161bd464832729be7f64be359c39825e47c6ec472f","observation_id":"7bb619fd-3ae7-4b92-be39-030ef025cdd1","resolution":{"observed_at":"2026-08-10T20:15:57.594375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03052","last_updated":"2022-06-01T09:24:35Z","snapshot_observed_at":"2026-08-20T14:59:05.580493Z","submitted_at":"2022-02-07T10:38:21Z","title":"OFA: Unifying Architectures, Tasks, and Modalities Through a Simple Sequence-to-Sequence Learning Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03052","snapshot_observed_at":"2026-08-10T20:15:57.436866Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.436866Z"},"links":{"cited_paper":"/paper/2202.03052","citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:0c79b76af391f2857451349af097ae805e315a31511d7f6e33404444eb42fd61","observation_id":"cfd59bb3-1d50-4eda-b3ef-a63716c5f551","resolution":{"observed_at":"2026-08-10T20:15:57.436866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.574411Z","title":null,"venue":null,"work_id":"af4da0f0-717e-46d4-9165-abdd865f72c9","year":2019},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.442081Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:24879f4f2eb75b556e67103aecc8e98482915c9f5d8821fd748a97ba29adbc3e","observation_id":"6f297336-97ea-49cb-ad28-15f75c0a3faa","resolution":{"observed_at":"2026-08-10T20:15:57.579246Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.559475Z","title":"Wiebe, R","venue":null,"work_id":"78889e9f-974a-465f-af40-78c65a624e4f","year":1999},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.447767Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:f065b55ee5fb598f2bdf3e23b3a6d0e0f4e6c8e2abc966aa3f611e81ae5c7c8f","observation_id":"3b56e3a8-1d5b-43c9-b3c7-34f17722c229","resolution":{"observed_at":"2026-08-10T20:15:57.564531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.545963Z","title":null,"venue":null,"work_id":"f9c8886c-07dc-40a8-a357-7d3cad0ef126","year":2015},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.453140Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:ae75302f683abe4a88cea99377deb237a48de9b91bc9bfdacea5e3fa330e47c4","observation_id":"c52b34b8-83bb-4507-9afc-5489490037ff","resolution":{"observed_at":"2026-08-10T20:15:57.550294Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:15:57.528922Z","title":"Zhang*, V","venue":null,"work_id":"6b61dad1-c690-4ade-887f-e30032780e0d","year":null},"citing_paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:57.460723Z"},"links":{"citing_paper":"/paper/2501.09155"},"observation_digest":"sha256:8b02b6a46d96ec2be4f89ba29dacac3969c7b2f8b13535f0c3b73a9f433bf7bd","observation_id":"13dc7e3b-ed98-4c18-81b6-f4a132436a48","resolution":{"observed_at":"2026-08-10T20:15:57.535594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.09155","last_updated":"2025-01-27T16:05:59Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T14:59:04.314901Z","submitted_at":"2025-01-15T21:14:36Z","title":"VCRScore: Image captioning metric based on V\\&L Transformers, CLIP, and precision-recall"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2501.09155."}