{"as_of":"2026-08-01T01:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:32298e5957a35ed6e4652a623cf5882300fb8eacee33eeb14f32a6530f6beb60","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T14:10:28.941565Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-31T06:34:12.847434+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.06080/citation-record","integrity":"/paper/2605.06080/integrity","json":"/paper/2605.06080/citation-record.json","paper":"/paper/2605.06080"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clip- score: A reference-free evaluation metric for image captioning","venue":null,"work_id":"8ccde017-7384-40b0-8b8a-9f0aa2e88699","year":2021},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:1d141c6a3ba78f030fe6729673f8f8faefb6e5e2a05e025912a463d39879eee4","observation_id":"54781691-ea75-4104-9622-155deafe3bce","resolution":{"observed_at":"2026-05-26T11:47:40.958658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Throne: An object-based hallucination benchmark for the free-form generations of large vision-language models","venue":null,"work_id":"6483aebd-4b8e-4846-8666-f92a91ab08a8","year":2024},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:c8827a0e229ff685beb00eee03604659ec599404cd3f489871428f5b41e0b625","observation_id":"9055bd95-11b9-4923-b293-aad02147f3db","resolution":{"observed_at":"2026-05-26T11:47:41.073221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:45cba747245a25161fd2dd3ffdf58e205b97172890ddc6dd9f0a49b258c881c6","observation_id":"869a73a3-2b58-4301-909d-fbae7dd547e7","resolution":{"observed_at":"2026-05-12T21:38:19.742717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptions","venue":null,"work_id":"12f5169f-22bb-44a5-b869-c321f29cd452","year":2014},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:8f711ca6268baa24d52fd3456299947efa8d14869e981167208371e54ed70ae9","observation_id":"a4ab99f1-ffed-48ed-acbf-5506866cead0","resolution":{"observed_at":"2026-05-26T11:47:40.944683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":"e264ef56-951b-42e5-bc26-63bb4e078684","year":2017},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:b69e9553d8fa9494dec97c9a3e6f62c0a158c1d4f51540c4d4a475b96960273b","observation_id":"98b0a2fd-e3e8-47ef-9034-5ac6194a0bf6","resolution":{"observed_at":"2026-05-26T11:47:41.046999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sugarcrepe: Fixing hackable benchmarks for vision-language compositionality","venue":null,"work_id":"9aae8bc7-d922-4e37-8f37-05e2015cae1a","year":2023},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:9ba5cc27c245063d337a3d48a58af73b9478388166bdd42d40fe18a249b1f351","observation_id":"9e778afd-a6a6-4399-8073-293ae476faeb","resolution":{"observed_at":"2026-05-26T11:47:41.051475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12329","last_updated":"2025-03-16T02:56:09Z","snapshot_observed_at":"2026-07-06T20:53:22.766594Z","submitted_at":"2025-03-16T02:56:09Z","title":"CapArena: Benchmarking and Analyzing Detailed Image Captioning in the LLM Era","version":1},"cited_work":{"arxiv_id":"2503.12329","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12329","snapshot_observed_at":"2026-07-04T12:59:53.203155Z","title":"Caparena: Benchmarking and analyzing detailed image captioning in the llm era","venue":null,"work_id":"3a834a5c-f568-41d2-8c80-ff752248b04f","year":2025},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"cited_paper":"/paper/2503.12329","citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:9a0d268252bbef3eddbb9d6659e0b8d55fd5ff71efde5fc3889e07ede05ec87b","observation_id":"c230eead-ff46-483a-99ae-30ad6364a4d3","resolution":{"observed_at":"2026-05-11T18:46:07.552941Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":"da03e118-9062-45d5-b3b5-81784b569c04","year":2024},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:04e04456a3e40d9d887fa0bfff780059276e06f344f05d8d01a7c44eafdcacbe","observation_id":"c52c58a5-e540-4f06-8c85-d40b89f2411d","resolution":{"observed_at":"2026-05-26T11:47:41.069470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06004","last_updated":"2024-06-10T03:57:39Z","snapshot_observed_at":"2026-07-06T18:27:54.379381Z","submitted_at":"2024-06-10T03:57:39Z","title":"FLEUR: An Explainable Reference-Free Evaluation Metric for Image Captioning Using a Large Multimodal Model","version":1},"cited_work":{"arxiv_id":"2406.06004","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.06004","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FLEUR: An Explainable Reference-Free Evaluation Metric for Image Captioning Using a Large Multimodal Model, June 2024","venue":null,"work_id":"aa739a30-300a-4aae-b3de-30660638df7b","year":2024},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"cited_paper":"/paper/2406.06004","citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:87f5b9f90e0c72c0d449a86b852c9db92bb9a175480aa47abba67f65cfda2284","observation_id":"b918d03a-481e-45c7-b05e-5696cfd3d5a1","resolution":{"observed_at":"2026-05-11T18:46:07.508399Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:3c737303c3e7d492f715a22fd0d216549a85d61eb1bda294dd5812b8f3306198","observation_id":"2d1d4eef-fd11-4c97-9462-3fef3d8599c1","resolution":{"observed_at":"2026-05-11T18:46:07.483189Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"558dff98-44d8-426e-9def-b8f9751502d1","year":2002},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:d519fcd959f54a77fb9158495609f4f46f03909c29ddfa028a10b1c832f4d75d","observation_id":"4715a2ed-4ec6-494d-b9c1-abeacaa07dd8","resolution":{"observed_at":"2026-05-26T11:47:41.035505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments","venue":null,"work_id":"a01d9180-86b7-4e3a-a3f3-89ac6a5586eb","year":2005},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:1a928cc8aa1330c6daf372d9c39529b07087586b48a3a7328b04a50641fec6b0","observation_id":"9be129dc-ff9c-4f77-94ad-126e4b75dc9d","resolution":{"observed_at":"2026-05-26T11:47:40.954055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rouge: A package for automatic evaluation of sum- maries","venue":null,"work_id":"7cd3cd29-3c6f-49de-9d2e-352b45165244","year":2004},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:b3af6878a7e2e245e48af08eafa2e914274ed1ac67a74ed376d57d561bb4d729","observation_id":"02132b53-5eb8-4ab7-baaa-33797ad0fc0d","resolution":{"observed_at":"2026-05-26T11:47:41.032044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cider: Consensus-based image description evaluation","venue":null,"work_id":"dc8b5a30-2766-4a17-9d45-93e76cc82b3b","year":2015},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:19752dfc4e0e7d18baf906e0de031394508f3588c3f14893f83b85e435e1f081","observation_id":"301afae1-fb2c-4da0-bd2e-7e35c2655305","resolution":{"observed_at":"2026-05-26T11:47:41.042425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spice: Semantic propositional image caption evaluation","venue":null,"work_id":"5c80e9dd-8f01-417f-b993-52989f2e164c","year":2016},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:96827555e491f1fa9a910858b5a860faf22b55d29ae48dcd9572cad9e3884982","observation_id":"2424202d-de61-4c12-bf01-83757c6c5115","resolution":{"observed_at":"2026-05-26T11:47:40.949293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":"2405.19092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-07-03T22:49:01.206350Z","title":"Benchmarking and improving detail image caption.ArXiv, abs/2405.19092","venue":null,"work_id":"23572c67-da01-476d-81cb-42e68cbc3817","year":2025},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:f9778839b75d8f8fce35ac3bd685fba765223462c2342de0edbee2f4c3caefac","observation_id":"b52990be-c408-4fb4-abbe-760ec644682e","resolution":{"observed_at":"2026-05-11T18:46:07.565923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-07-06T19:27:25.061335Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":"2410.03051","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-07-04T15:09:54.928668Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark","venue":null,"work_id":"3c75ba15-49f8-4ea3-87a8-6c357f825176","year":2024},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:a2f93a1c3568972f5e4384bb088a490184f8664816f0cc9bb6b03136af55cefe","observation_id":"1f19ee89-936f-4124-b487-3852d4baad26","resolution":{"observed_at":"2026-05-11T18:46:07.544729Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Umic: An unreferenced metric for image captioning via contrastive learn- ing","venue":null,"work_id":"cbb0cbd3-23cf-4c87-b04b-82104e6d67b1","year":2021},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:4252d85bf88181e0b74ca74304cf7300373c904a34e627899c5872c5e08fa23b","observation_id":"e6d474ce-061c-429b-8347-c51cfe3a9b2c","resolution":{"observed_at":"2026-05-26T11:47:41.028048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Positive-augmented contrastive learning for image and video captioning evaluation","venue":null,"work_id":"05157ceb-7efe-4a2c-bef8-145f58b2dc46","year":2023},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:e179e7bb4427c9a253841f8b84e0355b369f76cd4d38c291f97f29f0c3567609","observation_id":"d83fdf42-fd4f-463e-960e-d9367ce1dde7","resolution":{"observed_at":"2026-05-26T11:47:40.976279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Infometic: An informative metric for reference-free image caption evaluation","venue":null,"work_id":"771a8095-6868-41c8-b5a4-2d34b98f0342","year":2023},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:9f52357fa1f546b61fc223b75755177a7598b72403fc254f18f05a25e391e551","observation_id":"c0d0a9bd-66a9-4624-9c67-4146affd4373","resolution":{"observed_at":"2026-05-26T11:47:40.980905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bridge: Bridging gaps in image captioning evaluation with stronger visual cues","venue":null,"work_id":"47248b70-eb07-4f9d-a38d-5bb285a9b94e","year":2024},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:4e65c5486230a9428e517ed0db6a633611ce804a92ef4b670fe59586a928fa8b","observation_id":"2ca9da6d-1864-4547-aa8e-c8f034ad1fe3","resolution":{"observed_at":"2026-05-26T11:47:41.016584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hicescore: A hi- erarchical metric for image captioning evaluation","venue":null,"work_id":"9951ddd7-baa1-4131-a134-2bd2fd5cd34a","year":2024},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:c90549d365a383e7008d27ca09256e47665e019567015323d60d3e51bb41e6ef","observation_id":"d4c47991-3422-4f3a-a71b-e7679d565d92","resolution":{"observed_at":"2026-05-26T11:47:41.066050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Expert: An explain- able image captioning evaluation metric with structured explana- tions","venue":null,"work_id":"fce3f1d2-1312-430b-9adf-a7b49e8c25f6","year":2025},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:0e068ff5b50654fa8f8d101e522264e8fbcc2024f4b5e11962113bb92e4e6d63","observation_id":"3557c9ed-c8da-436f-9be5-1c46298b7a89","resolution":{"observed_at":"2026-05-26T11:47:40.966168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From word embeddings to document distances","venue":null,"work_id":"c962fa46-cac6-4d32-a442-ff1839805bdc","year":2015},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:9c616ed54d50c71585b14a7c8f2e133b4acd747f15a91567303a0ef13183fb35","observation_id":"607f18a7-d23b-45ae-83bc-33b0284efa94","resolution":{"observed_at":"2026-05-26T11:47:40.973241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sinkhorn distances: Lightspeed computation of opti- mal transport","venue":null,"work_id":"845a970b-93f7-4662-9b2a-aad15ac02643","year":2013},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:d4a0ccf5c48f000e1772f66360b68c07033085193fe3a76d6cb666fc7dd4aab6","observation_id":"f99960c9-edac-43bd-af13-889efa1f726e","resolution":{"observed_at":"2026-05-26T11:47:40.970024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Padim: a patch distribution modeling framework for anomaly detection and localization","venue":null,"work_id":"ccd498b1-9324-46dd-9cb6-f68d95a4b989","year":2021},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:e64e1c6039303edca2f9b8a0d36a179cc9361a4af98fcf0df776ffb480d8e8a3","observation_id":"4f99eda2-4440-4511-a12e-1bbb19c10c8c","resolution":{"observed_at":"2026-05-26T11:47:41.009079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gmmseg: Gaussian mix- ture based generative semantic segmentation models","venue":null,"work_id":"c7481aa0-2be3-4907-a97f-a4b4ebfe4c9e","year":2022},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:abeb608315bbcec8586252bbd2f8a0f1a4e9e10f8e6be3eca251dc57cbbb0661","observation_id":"07c714ec-fb59-4b89-b49d-b21557e6059f","resolution":{"observed_at":"2026-05-26T11:47:41.012978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-07-11T01:17:42.597062Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:a114bc0225f6186141bbaf6c208df5074a7579c2eae65055e9fc7731714f8652","observation_id":"d64b961c-b122-4fd1-aeb4-6e95aff51174","resolution":{"observed_at":"2026-05-11T18:46:07.513973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-07-10T13:27:05.574543Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:61434294fe75ec8b78004e9610ba603406c83a1ebb983ec1cbc9c32745be08cd","observation_id":"a59ed399-d2e2-4860-99b6-863c75c156be","resolution":{"observed_at":"2026-05-11T18:46:07.586036Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-critic: Learning to evaluate multimodal models","venue":null,"work_id":"40cc5f2d-b891-46fb-8382-4bc31e27a27c","year":2025},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:0d81602c1cf7c0acd5dbedb63333d7724b4808e400d554920511acb2ef9111b3","observation_id":"87d6895c-17bb-442c-81d9-60ab5153d7f0","resolution":{"observed_at":"2026-05-26T11:47:41.020339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16634","last_updated":"2023-05-23T22:12:16Z","snapshot_observed_at":"2026-07-06T15:09:29.225079Z","submitted_at":"2023-03-29T12:46:54Z","title":"G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment","version":3},"cited_work":{"arxiv_id":"2303.16634","doi":"10.48550/arxiv.2303.16634","metadata_source":"pith","pith_arxiv_id":"2303.16634","snapshot_observed_at":"2026-07-10T10:27:02.404274Z","title":"G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment","venue":"cs.CL","work_id":"6bc7f654-ec90-4d95-b023-416717a28f45","year":2023},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"cited_paper":"/paper/2303.16634","citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:a5b60f6921f9765fbb9e01bb414a1ece0a0869514fdd0411917e9c926a1ff881","observation_id":"89398c45-a231-46fe-9c45-72979882a1cc","resolution":{"observed_at":"2026-05-12T22:55:50.972702Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-05-20T14:22:05.615976+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T14:22:05.615976+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"1429fb84-3e3c-4056-a92f-d91b7f465708","year":2021},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:f070c0f54a8b12b5a1310a89fb312d55103fa7cc7c8eedebd401b3af7333006b","observation_id":"049c88a5-1307-4e14-b643-5450eb6f59a9","resolution":{"observed_at":"2026-05-26T11:47:41.055562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":"2502.14786","doi":"10.48550/arxiv.2502.14786","metadata_source":"pith","pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":"cs.CV","work_id":"50eec732-2d41-432f-9dcf-ac7fff235ea5","year":2025},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:2b1d55db6f76f17cf51e23612101d829feda990bb71e2ee8fbc39f9f6f23de5d","observation_id":"28573fd4-b6de-477e-8406-dcce6d77c09a","resolution":{"observed_at":"2026-05-11T18:46:07.621338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.19060","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Posh: Using scene graphs to guide llms-as-a-judge for detailed image descriptions","venue":null,"work_id":"9d7105c4-645e-489b-9bc9-68ec1b571116","year":2025},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:8decb6ea606ccfb480ece47c6f33c7a9c256c42817a828ca077d44ddf1031a3c","observation_id":"085330d4-ea79-4738-aed5-7a5dcc20c94e","resolution":{"observed_at":"2026-05-11T18:46:07.526746Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clustering on the unit hypersphere using von mises-fisher dis- tributions","venue":null,"work_id":"8526563e-7145-4a6b-bea3-6f6f72141312","year":2005},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:66f377c655a35847de0370e1d216f7e745dbc5096acec32be809db1b399e650f","observation_id":"63402b98-05ab-4ac6-9ce2-725a8f97f5a7","resolution":{"observed_at":"2026-05-26T11:47:41.062177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Framing image de- scription as a ranking task: Data, models and evaluation metrics","venue":null,"work_id":"a352cb49-5265-449d-8015-db1d61eea572","year":2013},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:a21f8645453bd647496021e6805d8c2329fe1a900f4db045eb799da68ba6e299","observation_id":"9f517e4c-5113-4176-b7d7-03ac1eebf5d0","resolution":{"observed_at":"2026-05-26T11:47:41.001063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.03292","last_updated":"2015-11-10T21:14:51Z","snapshot_observed_at":"2026-07-06T04:36:02.911118Z","submitted_at":"2015-11-10T21:14:51Z","title":"From Images to Sentences through Scene Description Graphs using Commonsense Reasoning and Knowledge","version":1},"cited_work":{"arxiv_id":"1511.03292","doi":null,"metadata_source":"pith","pith_arxiv_id":"1511.03292","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From Images to Sentences through Scene Description Graphs using Commonsense Reasoning and Knowledge","venue":"cs.CV","work_id":"dd4c908a-9217-463d-852e-1034998769f6","year":2015},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"cited_paper":"/paper/1511.03292","citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:a3443e310c916533b5a953dedacd8c83f9486f50e8ab801046a049fb2f8219fe","observation_id":"b050876f-b197-4685-b5fe-2395b048a990","resolution":{"observed_at":"2026-05-11T18:46:07.522134Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"5988a1e8-10b8-45b4-a6e9-5fa5a8e85656","year":2014},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:495a745f911054b71a2abc30cfc1b5b45ed1e3c591c1df8873e14d2026995ea5","observation_id":"11fd0a3e-2f81-497d-a307-bc04f2d90388","resolution":{"observed_at":"2026-05-26T11:47:41.004531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Polos: Multimodal metric learning from human feedback for image captioning","venue":null,"work_id":"1fa108ff-6da4-4de6-8ed9-86aa06f17f4f","year":2024},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:48371e942ca3452f78b5ea19a2e31b15ae8f8989cf6fbcfcec72d7c3bf294390","observation_id":"0cd47007-d949-419f-bb62-6e2f9756d52a","resolution":{"observed_at":"2026-05-26T11:47:40.993371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning","venue":null,"work_id":"1ce5cb18-8fba-4e18-b2d9-f94c9554e921","year":2023},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:828f2ab1ecdce5f4f1c20011e8647dd68395da18e1039d81fb24825a5b7e1118","observation_id":"cf2dcef4-ab7e-420c-a212-c899c8ec6084","resolution":{"observed_at":"2026-05-26T11:47:40.984187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-11T01:17:45.013705Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:849236d7ce5f5f30d8adf5c2bb35c9a593036de697c4433fdabe819daa0c4103","observation_id":"a8f027ad-e7b4-443f-bbd2-82172d7a6e4d","resolution":{"observed_at":"2026-05-11T18:46:07.556984Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10004","last_updated":"2024-06-18T11:58:39Z","snapshot_observed_at":"2026-08-01T00:56:07.672418Z","submitted_at":"2024-05-16T11:44:35Z","title":"ROCOv2: Radiology Objects in COntext Version 2, an Updated Multimodal Image Dataset","version":2},"cited_work":{"arxiv_id":"2405.10004","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.10004","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rocov2: Radiology objects in context version 2, an updated multimodal image dataset","venue":null,"work_id":"f1ba8bcd-1a21-4182-8b12-1ea2846fe7a9","year":2024},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"cited_paper":"/paper/2405.10004","citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:c01aab3173b9fde3a96ed32a394a6929a2d29b43437f9dcd50b228f2aac16ace","observation_id":"66142c78-6574-46dd-a2e6-541bd6ba2811","resolution":{"observed_at":"2026-05-11T18:46:07.539220Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring models and data for remote sensing image caption generation","venue":null,"work_id":"e2de90c0-07fd-4777-b7eb-748a90da7cef","year":2018},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:1cd5bce1f2fe715d6d603c84cb4ac57267eed7d3a1b9a4e59f6562c468c6f735","observation_id":"96b2ba7b-03f4-4a55-9c01-a8d3ffd62579","resolution":{"observed_at":"2026-05-26T11:47:40.997852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00915","last_updated":"2025-01-08T22:58:51Z","snapshot_observed_at":"2026-07-06T14:57:39.647497Z","submitted_at":"2023-03-02T02:20:04Z","title":"BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs","version":3},"cited_work":{"arxiv_id":"2303.00915","doi":"10.48550/arxiv.2303.00915","metadata_source":"pith","pith_arxiv_id":"2303.00915","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs","venue":"cs.CV","work_id":"6fcf8750-00b8-4f3e-9f0b-965a879a5dff","year":2023},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"cited_paper":"/paper/2303.00915","citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:f195a4c46aaf798a1c0805e130b1709383d56ab384edd111c21274490a1c7129","observation_id":"0876db0a-3ffe-4121-858a-12cf7a5c3241","resolution":{"observed_at":"2026-05-13T10:42:22.536059Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11029","last_updated":"2024-04-16T11:24:36Z","snapshot_observed_at":"2026-07-06T15:44:16.142806Z","submitted_at":"2023-06-19T15:46:41Z","title":"RemoteCLIP: A Vision Language Foundation Model for Remote Sensing","version":4},"cited_work":{"arxiv_id":"2306.11029","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.11029","snapshot_observed_at":"2026-07-03T00:27:30.069800Z","title":"RemoteCLIP: A Vision Language Foundation Model for Remote Sensing, April 2024","venue":null,"work_id":"097f5b39-8255-4e27-bc13-05d93d37a753","year":2023},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"cited_paper":"/paper/2306.11029","citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:56d88e47dc6b6c38d4b6ee8b46420d5569e62136ea9552a09f2376eee7517e14","observation_id":"01f8a5f8-c8e7-46cf-9c54-7ce69ad90018","resolution":{"observed_at":"2026-05-11T18:46:07.533982Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T12:52:29.888484Z","title":"Internvl: Scaling up vision foun- dation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"a903b9fb-83ad-4631-b6a6-58fef3e80b58","year":2024},"citing_paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-08T14:10:28.941565Z"},"links":{"citing_paper":"/paper/2605.06080"},"observation_digest":"sha256:7f5a04d90774fe6d050b1ec67b0580374586c0649d15ec047cf8752dd9bc8271","observation_id":"f9ecb5c5-5528-4a4d-b1b3-83961ab37351","resolution":{"observed_at":"2026-05-26T11:47:40.987828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.06080","last_updated":"2026-05-07T12:02:23Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T12:02:23Z","title":"MSD-Score: Multi-Scale Distributional Scoring for Reference-Free Image Caption Evaluation"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":16,"verified_fuzzy":30},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"thesis":"As of 1 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2605.06080."}