{"as_of":"2026-08-11T12:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1dfdb0dd03a648d157961fe6dd89a56c1d81b2f606eddeef70eb96048dfb9f47","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:58:40.901060Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T13:13:57.599970Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T05:47:41.745200Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2508.06125","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06125","snapshot_observed_at":"2026-07-03T05:47:41.745200Z","title":"Sc-captioner: Improving image captioning with self-correction by reinforcement learning.ArXiv preprint, abs/2508.06125, 2025","venue":null,"work_id":"8619eced-6286-4f52-a4de-732f3c1c7fd2","year":2025},"citing_paper":{"arxiv_id":"2605.28023","last_updated":"2026-05-27T06:27:04Z","snapshot_observed_at":"2026-08-02T21:20:31.316522Z","submitted_at":"2026-05-27T06:27:04Z","title":"VCap: Hypergeometric Rewards for Weak-to-Strong Visual Captioning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-29T13:13:57.599970Z"},"links":{"cited_paper":"/paper/2508.06125","citing_paper":"/paper/2605.28023"},"observation_digest":"sha256:73c59dbd099110b01798b9812007af4d525d0f6933c954795b3cbcb26da3b51e","observation_id":"13681d6c-ab6c-4375-8891-fa98f517130c","resolution":{"observed_at":"2026-06-29T13:23:28.464514Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2508.06125","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06125","snapshot_observed_at":"2026-07-03T05:47:41.745200Z","title":"Sc-captioner: Improving image captioning with self-correction by reinforcement learning.ArXiv preprint, abs/2508.06125, 2025","venue":null,"work_id":"8619eced-6286-4f52-a4de-732f3c1c7fd2","year":2025},"citing_paper":{"arxiv_id":"2606.11074","last_updated":"2026-06-10T03:48:53Z","snapshot_observed_at":"2026-08-02T04:11:10.383026Z","submitted_at":"2026-06-09T16:34:37Z","title":"Modeling Complex Behaviors: Multi-Personality Composition and Dynamic Switching in Vision-Language Models","version":2},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-06-27T13:04:14.886733Z"},"links":{"cited_paper":"/paper/2508.06125","citing_paper":"/paper/2606.11074"},"observation_digest":"sha256:5b532c26d8a006396a1d99be7b552c71005c87ca05b5da0bf3c6c389e9f11962","observation_id":"32df02c4-e8c5-432c-9613-d439311c6804","resolution":{"observed_at":"2026-07-03T05:47:41.747057Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.06125/citation-record","integrity":"/paper/2508.06125/integrity","json":"/paper/2508.06125/citation-record.json","paper":"/paper/2508.06125"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T22:58:33.378135Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:33.378135Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:cf72f64d0d222e2b1a774024069395f2f849fdff8598dd47355ff325624495a7","observation_id":"5e3188e3-386c-4c21-9782-4ab79c49b35a","resolution":{"observed_at":"2026-08-05T22:58:33.378135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:48.525701Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with hu- man judgments","venue":null,"work_id":"79ccf4b5-f087-4e49-8556-226ee757ac07","year":2005},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:33.457218Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:06e3ceb2a6851cf213a2173e24df4cdbcf9532f4a91a2a97259bc94a9ebffb59","observation_id":"9f187492-904b-4d1b-ae95-48249658e748","resolution":{"observed_at":"2026-08-05T22:58:48.647640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-05T22:58:33.568450Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:33.568450Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:cf254ac93a04acacfc00ccb3745ea47286d388b67975091f38ae74c9298611fa","observation_id":"81029bf8-c384-4591-b8db-6149b0d2cb01","resolution":{"observed_at":"2026-08-05T22:58:33.568450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T22:58:33.657104Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:33.657104Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:d1844b483e8d34b23e8df2326748a1c1e877fe88e85ab52f73527dc17a6387dd","observation_id":"da60b3e5-d993-46ec-b9e0-2c35daee4b04","resolution":{"observed_at":"2026-08-05T22:58:33.657104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-05T22:58:33.759054Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:33.759054Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:fe5243f5c944e3986325cffa3ad7f3a87f9043857d438908af6efa4d0e0110ef","observation_id":"54adc342-0533-4de7-98ec-c65214ca9fa3","resolution":{"observed_at":"2026-08-05T22:58:33.759054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:33.847904Z","title":"Meshed-memory transformer for image cap- tioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:33.847904Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:d05cac20b59960abb67335a5195ccc8e8feab764a55b759a47831aaa27abff58","observation_id":"91375458-db5f-4dd4-b3d5-57eaf63c1781","resolution":{"observed_at":"2026-08-05T22:58:33.847904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:48.278987Z","title":"Cross-domain image captioning with dis- criminative finetuning","venue":null,"work_id":"f5373b83-8254-443c-885d-d07d9554c14e","year":2023},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:33.971679Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:214ba2ca7dabaa02d865126aaa7f8e8d99dbe0b630e929763b1878fa575a45a5","observation_id":"7bd57807-a7c1-4248-af0a-f4f95a150ad8","resolution":{"observed_at":"2026-08-05T22:58:48.411911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-08-05T22:58:34.074648Z","title":"Benchmarking and improv- ing detail image caption","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:34.074648Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:9554a337a70a601356c34a9dae5816ead67a90695119dea07c6e0b66746bc09f","observation_id":"f4df095d-74b4-4c46-ba70-32982931c397","resolution":{"observed_at":"2026-08-05T22:58:34.074648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17453","last_updated":"2024-10-31T23:23:22Z","snapshot_observed_at":"2026-07-06T18:51:23.832577Z","submitted_at":"2024-07-24T17:37:05Z","title":"VILA$^2$: VILA Augmented VILA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17453","snapshot_observed_at":"2026-08-05T22:58:34.166423Z","title":"����� �: Vila augmented vila","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:34.166423Z"},"links":{"cited_paper":"/paper/2407.17453","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:e4e6c7ffca3b8005bf605543f8a3e041c585fbc23a357509ff4d1714f8a54d95","observation_id":"20e663f2-2d1a-4896-be48-dd4eba14e8d2","resolution":{"observed_at":"2026-08-05T22:58:34.166423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07459","last_updated":"2023-02-18T21:30:27Z","snapshot_observed_at":"2026-07-06T14:51:56.435442Z","submitted_at":"2023-02-15T04:25:40Z","title":"The Capacity for Moral Self-Correction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07459","snapshot_observed_at":"2026-08-05T22:58:34.281893Z","title":"The capacity for moral self-correction in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:34.281893Z"},"links":{"cited_paper":"/paper/2302.07459","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:5e13e1fac60d6f135e04ccbf9881f2bfee41f715fe0388ffe197f2ea217ab493","observation_id":"3bb6d37e-5fe3-4eee-ba19-fa80475479ff","resolution":{"observed_at":"2026-08-05T22:58:34.281893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10963","last_updated":"2024-06-25T03:14:10Z","snapshot_observed_at":"2026-08-05T17:51:38.668510Z","submitted_at":"2024-02-13T20:16:29Z","title":"GLoRe: When, Where, and How to Improve LLM Reasoning via Global and Local Refinements","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10963","snapshot_observed_at":"2026-08-05T22:58:34.400113Z","title":"Glore: When, where, and how to im- prove llm reasoning via global and local refinements","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:34.400113Z"},"links":{"cited_paper":"/paper/2402.10963","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:0c8d9e3d5335ed73312b477fdec53827b0a48a59d8c8bd80dcabfbbd69398a6a","observation_id":"63882c2d-434b-4b7d-ae1f-80fc475e7235","resolution":{"observed_at":"2026-08-05T22:58:34.400113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04055","last_updated":"2025-06-05T13:25:43Z","snapshot_observed_at":"2026-08-10T18:39:56.065076Z","submitted_at":"2024-10-05T06:28:54Z","title":"Self-Correction is More than Refinement: A Learning Framework for Visual and Language Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04055","snapshot_observed_at":"2026-08-05T22:58:34.507296Z","title":"Self-correction is more than refinement: A learning frame- work for visual and language reasoning tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:34.507296Z"},"links":{"cited_paper":"/paper/2410.04055","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:558acc8ddea1284b25e3250fee768f01cca43d212e31851858b1f498eb4b2a6b","observation_id":"2540fa4c-3e07-4c8f-815c-a1408909e327","resolution":{"observed_at":"2026-08-05T22:58:34.507296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:34.625129Z","title":"A topic-level self-correctional ap- proach to mitigate hallucinations in mllms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:34.625129Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:69667acf4e1095670709dbf52311de7eabffeae82b9f4aae89d0a83081c5ade8","observation_id":"06beefce-f4e2-438e-98c5-055501d80fba","resolution":{"observed_at":"2026-08-05T22:58:34.625129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-05T22:58:34.731038Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:34.731038Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:cae1e834163525ef1cbbb8d5b0050088731bec3466cd1e6167586ce383e1d99a","observation_id":"b91d7e3c-1ff0-4f04-993b-0eb487e04923","resolution":{"observed_at":"2026-08-05T22:58:34.731038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06723","last_updated":"2025-02-26T22:54:53Z","snapshot_observed_at":"2026-08-01T03:00:29.379863Z","submitted_at":"2024-07-09T09:55:04Z","title":"Graph-Based Captioning: Enhancing Visual Descriptions by Interconnecting Region Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06723","snapshot_observed_at":"2026-08-05T22:58:34.844196Z","title":"Graph-based captioning: Enhancing visual descrip- tions by interconnecting region captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:34.844196Z"},"links":{"cited_paper":"/paper/2407.06723","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:866996f8ffa9b7c83ccd4975aee7af7660312ebfcfc53780fc02da8daccc54ed","observation_id":"d374d9dd-bcc8-483e-b97a-32676950de1c","resolution":{"observed_at":"2026-08-05T22:58:34.844196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:35.005045Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:35.005045Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:766ea1884d6641eb8f644c1388229eeefcfe652e90bf430fff72d9aeeb6af55e","observation_id":"37921116-0a10-4ca5-ab78-f61a39f1545b","resolution":{"observed_at":"2026-08-05T22:58:35.005045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01798","last_updated":"2024-03-14T04:27:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T04:56:12Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01798","snapshot_observed_at":"2026-08-05T22:58:35.116852Z","title":"Large language models cannot self-correct reasoning yet","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:35.116852Z"},"links":{"cited_paper":"/paper/2310.01798","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:e7c5b001ce71936a33282446bd81eda969c369ed849b5b42f25a3ebd7b2861ab","observation_id":"00203f23-2d0f-4019-9c19-e14d37591905","resolution":{"observed_at":"2026-08-05T22:58:35.116852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:48.112641Z","title":"Attention on attention for image captioning","venue":null,"work_id":"75d7d3aa-1c66-4581-a03a-656f5c87521c","year":2019},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:35.236922Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:82d8530e06d1ea201eba990134d4cfbf02c650b31da17c72eb92930ea243d28e","observation_id":"3a743dbd-9b49-4019-a201-28a5b9079e57","resolution":{"observed_at":"2026-08-05T22:58:48.204818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01297","last_updated":"2024-12-03T19:14:06Z","snapshot_observed_at":"2026-08-11T09:11:05.591270Z","submitted_at":"2024-06-03T13:05:46Z","title":"When Can LLMs Actually Correct Their Own Mistakes? A Critical Survey of Self-Correction of LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01297","snapshot_observed_at":"2026-08-05T22:58:35.361067Z","title":"When can llms actually correct their own mistakes? a critical survey of self-correction of llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:35.361067Z"},"links":{"cited_paper":"/paper/2406.01297","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:0562ddef13e47a643684ea1436287d5b9ec76b34f79073bdc51c923516daf75d","observation_id":"ea6d09f7-4d09-4c89-865f-0c382b07344a","resolution":{"observed_at":"2026-08-05T22:58:35.361067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-05T22:58:35.455107Z","title":"Training language models to self-correct via reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:35.455107Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:0374746c7d9098e6bd9be06479a8627c6c9326fd1e8e6b2fc017803097b85345","observation_id":"4685203a-1490-4f17-bcf3-cebe0123f324","resolution":{"observed_at":"2026-08-05T22:58:35.455107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.12560","last_updated":"2021-08-28T03:04:28Z","snapshot_observed_at":"2026-08-06T07:10:20.193641Z","submitted_at":"2021-08-28T03:04:28Z","title":"QACE: Asking Questions to Evaluate an Image Caption","version":1},"cited_work":{"arxiv_id":"2108.12560","doi":null,"metadata_source":"pith","pith_arxiv_id":"2108.12560","snapshot_observed_at":"2026-08-05T22:58:41.396971Z","title":"QACE: Asking Questions to Evaluate an Image Caption","venue":"cs.CL","work_id":"377068d6-b322-4679-b328-65dc9b94ecb7","year":2021},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:35.624153Z"},"links":{"cited_paper":"/paper/2108.12560","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:5213d93f4a5cb5338aeae34e645551fffd715a2333d572be8a195844de840ef5","observation_id":"c4a0e725-8dca-46cc-a87e-50b4e00b0c9c","resolution":{"observed_at":"2026-08-05T22:58:41.513395Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:47.946769Z","title":"Fleur: An explainable reference-free evaluation metric for image cap- tioning using a large multimodal model","venue":null,"work_id":"b59f6dc8-0a10-47cd-a581-328a946f8f12","year":2024},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:35.769242Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:35bc4c5c587d9fdfb3e4c4218acf532ddad2d9ee10afb58d33202fbd678709c2","observation_id":"799cc422-8eb3-49af-a754-0a55aa35e79b","resolution":{"observed_at":"2026-08-05T22:58:48.016979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:35.859637Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:35.859637Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:169b22a14f81f561f81ca753c21103a715c8e8f7ee34b0394c5045ca9212ca28","observation_id":"0a8e2c5b-f20b-4ba8-bc43-6cd5433ca931","resolution":{"observed_at":"2026-08-05T22:58:35.859637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:47.762105Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"e6cf2450-5ef6-47fc-ada0-018c7dafe91d","year":2023},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:35.970216Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:7f5810ea2a7571d06496754995be32fa9461ba41b2c6d11a174d5020edc1282c","observation_id":"4744dc6d-d104-4962-9f6c-e6cf2ee0aab3","resolution":{"observed_at":"2026-08-05T22:58:47.858272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17497","last_updated":"2023-06-01T04:56:26Z","snapshot_observed_at":"2026-08-02T04:26:22.991382Z","submitted_at":"2023-05-27T15:38:31Z","title":"FACTUAL: A Benchmark for Faithful and Consistent Textual Scene Graph Parsing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17497","snapshot_observed_at":"2026-08-05T22:58:36.145548Z","title":"Factual: A benchmark for faithful and consistent tex- tual scene graph parsing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:36.145548Z"},"links":{"cited_paper":"/paper/2305.17497","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:0f9bce93e6ca2d0f81c6e6d0b3a019d2c9c98213f29640caa227fb75abf69763","observation_id":"243f5353-fe70-4540-9a9e-2fe480bc6f85","resolution":{"observed_at":"2026-08-05T22:58:36.145548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:47.550942Z","title":"Mon- key: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"4bbd9c3b-559b-4836-980f-0496f779bdd3","year":2024},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:36.281087Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:f7ae58f3557438e66ff2db7bc9e1d0c8261f334370dbc916166a7cefa06eda9f","observation_id":"75eef57d-30b7-43ab-9547-73adf55f69ef","resolution":{"observed_at":"2026-08-05T22:58:47.661173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-07-06T19:16:23.103921Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-05T22:58:36.402785Z","title":"Playground v3: Improving text-to- image alignment with deep-fusion large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:36.402785Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:f10963292fbe46a4e467b90b3ab5825f3acef65e0a3eeb484012ccdefe1bc3b0","observation_id":"2799051a-0be3-4f43-b590-fc8bc919b5c3","resolution":{"observed_at":"2026-08-05T22:58:36.402785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:47.342675Z","title":"Attention correctness in neural image captioning","venue":null,"work_id":"9272ba15-80a5-42c7-88fb-6fa9e21a18fb","year":2017},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:36.515020Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:71faba13494298c7532db4a31af4982092822ba2e1bd9da20868aaa2a2e28c0c","observation_id":"d843b8d9-6d8b-4100-b8db-cb4b2d9a44a8","resolution":{"observed_at":"2026-08-05T22:58:47.435775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:47.152225Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"9292a11a-8ae4-4c34-8c15-f858650d719a","year":2024},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:36.641783Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:0e2dd451372d6441477e951e0cd899427f9bcf9b63b4e45f26c5758fc0709734","observation_id":"505f2ecf-d03b-4ad9-9120-e598a5047645","resolution":{"observed_at":"2026-08-05T22:58:47.252670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:46.894796Z","title":"Improved image captioning via policy gra- dient optimization of spider","venue":null,"work_id":"fad0363a-bfba-4905-8e0e-0e09758a45b3","year":null},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:36.770853Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:689ba03316d64a9f2993064b2a587b903405da3c63992c903ded9b9c91621667","observation_id":"37e799a1-e9e0-4b04-881d-a42c76960982","resolution":{"observed_at":"2026-08-05T22:58:47.053072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07089","last_updated":"2025-06-02T09:38:26Z","snapshot_observed_at":"2026-08-07T21:01:40.617151Z","submitted_at":"2025-04-09T17:58:58Z","title":"OmniCaptioner: One Captioner to Rule Them All","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07089","snapshot_observed_at":"2026-08-05T22:58:36.852405Z","title":"Omnicaptioner: One captioner to rule them all","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:36.852405Z"},"links":{"cited_paper":"/paper/2504.07089","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:544dbea1c1eda51d328cbae858d8575e16fdd58632f181a917e5c63d0379f2bb","observation_id":"e91735c6-df67-4819-b970-c7a0857b77f5","resolution":{"observed_at":"2026-08-05T22:58:36.852405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:46.650391Z","title":"Self-refine: It- erative refinement with self-feedback","venue":null,"work_id":"4b7a4300-f5b3-49ef-b9a8-f91b1f123e13","year":2024},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:36.969470Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:675a7ae24bbeb388be0c1f5482a6c64dd53dc04a927d3357072f9d26e1ea1c88","observation_id":"96c8ce27-17b8-40b4-ad4a-746c5b2b2ca1","resolution":{"observed_at":"2026-08-05T22:58:46.771264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19753","last_updated":"2024-04-30T17:56:24Z","snapshot_observed_at":"2026-07-06T18:07:47.744531Z","submitted_at":"2024-04-30T17:56:24Z","title":"DOCCI: Descriptions of Connected and Contrasting Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19753","snapshot_observed_at":"2026-08-05T22:58:37.077028Z","title":"Docci: Descriptions of connected and contrasting images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:37.077028Z"},"links":{"cited_paper":"/paper/2404.19753","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:4ab42a06cdcb2d29b90f36e24c2d3bf5312cb79d2edfbd220eaeb024920e6924","observation_id":"26230f63-8435-458b-aceb-cb054c5dfbb1","resolution":{"observed_at":"2026-08-05T22:58:37.077028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:46.378680Z","title":"Automat- ically correcting large language models: Surveying the land- scape of diverse automated correction strategies","venue":null,"work_id":"83a69859-c548-496b-8a4a-79d774ad4e76","year":2024},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:37.169905Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:fc4328d34a676a117946ae464bf287b267a3b1aaee4d12e998ac0bf05cf57401","observation_id":"99e96986-63ee-4bb0-836c-0245245c421e","resolution":{"observed_at":"2026-08-05T22:58:46.525560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:37.288984Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:37.288984Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:63822f74335eab7e5c42605f08fa69db37b3539d465d93dea1c5ab0a93e95d4d","observation_id":"75aa1382-222b-4f8a-9222-f898f73c193a","resolution":{"observed_at":"2026-08-05T22:58:37.288984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:46.096463Z","title":"Connecting vision and lan- guage with localized narratives","venue":null,"work_id":"9fae435a-f2aa-4e9d-959d-38b1880d3905","year":2020},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:37.415476Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:2bf7fc9a5ccc203b3bf460ff190edfca530f4055deacbdc4d4c63dd0b2cf1182","observation_id":"3041647a-bb19-40b0-b259-83ba4ea9c0a0","resolution":{"observed_at":"2026-08-05T22:58:46.223990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.20513","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:41.140533Z","title":"Is moral self-correction an innate capability of large language models? a mechanistic analysis to self-correction","venue":null,"work_id":"f39d854b-b8b9-4ac8-b852-d4ce4160a638","year":2024},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:37.565099Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:91f37c83e5527b7ef724880c9e4bf200057ae995c59d4919bfb6d6ff8a7ca338","observation_id":"91ebfb98-f1e2-4576-9d57-331776b8c3f2","resolution":{"observed_at":"2026-08-05T22:58:41.231786Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18219","last_updated":"2024-07-26T17:50:27Z","snapshot_observed_at":"2026-08-07T12:10:53.303603Z","submitted_at":"2024-07-25T17:35:59Z","title":"Recursive Introspection: Teaching Language Model Agents How to Self-Improve","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18219","snapshot_observed_at":"2026-08-05T22:58:37.669243Z","title":"Recursive introspection: Teaching language model agents how to self-improve","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:37.669243Z"},"links":{"cited_paper":"/paper/2407.18219","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:c73a4630aa626aa629772721df169ca9a808304e18ec7d3f81bcd84310351e40","observation_id":"690e37c7-23ff-4ae4-8dff-7e1464162d0c","resolution":{"observed_at":"2026-08-05T22:58:37.669243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:37.816834Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:37.816834Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:d7a998a08e78c4f4bbace0ec5b36f5bd595e0466a153b59dc5b2528db067aaea","observation_id":"c32ae3a1-84b9-4e9a-b43e-c5d0b3017141","resolution":{"observed_at":"2026-08-05T22:58:37.816834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:45.852845Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"4aec5e1b-6c4d-45f0-94ca-e601c64d3e1f","year":2023},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:37.939922Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:900ff625da807efe7fb361ac22c402f742c365c76363c2d55488053564e0c036","observation_id":"9dfca791-a63c-4c28-9642-96780ec9c911","resolution":{"observed_at":"2026-08-05T22:58:45.984325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:45.558662Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"2180fa3f-1c4f-44f7-86d3-feff2e13db79","year":2024},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:38.045115Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:9135c5a296237e3a4738f509057f8646d2f09a6adbbf92723322cb38c3640cca","observation_id":"08c782bd-6a05-4080-a722-53ccfdf62425","resolution":{"observed_at":"2026-08-05T22:58:45.681047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:45.317749Z","title":"Glamm: Pixel grounding large multimodal model","venue":null,"work_id":"df919fef-c09f-43df-a8e8-2ec3bba42fe4","year":2024},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:38.171749Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:5eb429f2705137f601fa0d2b982b4f52a1ce6dc76aec2665e5d44471e5771dbe","observation_id":"c9852579-f688-40ca-bf6f-6fd376369061","resolution":{"observed_at":"2026-08-05T22:58:45.453769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:45.072931Z","title":"Positive-augmented contrastive learning for image and video captioning evaluation","venue":null,"work_id":"71d316a2-d2d5-4f4c-8c8e-aa68896f05c4","year":2023},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:38.323923Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:1a6be5ad256c4cd32896e5ebd4e4b55b3ae0c692d25dbe624f1cb8ce3b5df793","observation_id":"f95dadf4-f361-455e-9a76-a5ed4739755c","resolution":{"observed_at":"2026-08-05T22:58:45.194254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:44.782342Z","title":"Bridge: Bridging gaps in image captioning evalua- tion with stronger visual cues","venue":null,"work_id":"d4ef353c-5314-4aec-b311-437a124e6a18","year":2025},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:38.472255Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:a99e201422ce03dc79c866f7bf4c4de9ef643c1ac587d613b43138899638337a","observation_id":"33b2b492-5123-4879-8039-604b1a969401","resolution":{"observed_at":"2026-08-05T22:58:44.930966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16938","last_updated":"2025-07-22T15:05:22Z","snapshot_observed_at":"2026-08-10T06:22:47.542493Z","submitted_at":"2025-05-22T17:27:43Z","title":"InternAgent: When Agent Becomes the Scientist -- Building Closed-Loop System from Hypothesis to Verification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16938","snapshot_observed_at":"2026-08-05T22:58:38.568367Z","title":"Novelseek: When agent becomes the scientist–building closed-loop system from hy- pothesis to verification","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:38.568367Z"},"links":{"cited_paper":"/paper/2505.16938","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:8aebf213ac3f23b0db073f37f9e3ed488e1aa97c46917758133c42cd504c42bd","observation_id":"f87fb521-c4d0-4be9-b65c-03c0c6660ccd","resolution":{"observed_at":"2026-08-05T22:58:38.568367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:44.531015Z","title":"A picture is worth more than 77 text tokens: Evaluating clip-style models on dense captions","venue":null,"work_id":"78460f6c-53b2-4342-b339-50faa9d25d1b","year":2024},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:38.680862Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:87002646db0162cdf6a0bca5d6d5c06a26689eb51e0babd342606be17fdd554a","observation_id":"681ebff4-3477-47b3-a968-b5b0caffed6b","resolution":{"observed_at":"2026-08-05T22:58:44.663601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:44.302533Z","title":"Cider: Consensus-based image description evalua- tion","venue":null,"work_id":"54be75dc-02ce-4d44-a9e3-bbfca864af36","year":2015},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:38.823823Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:b092bc4365e0dc4fdcc8452d6840f93ef26d728d3a2eba8c68baf6d812b01403","observation_id":"21eca74e-7c51-4579-b5c0-ab70b2cc16c6","resolution":{"observed_at":"2026-08-05T22:58:44.398320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:43.992352Z","title":"Show and tell: A neural image caption gen- erator","venue":null,"work_id":"e6fd433e-e73e-47cb-9b27-6163fd99ab13","year":2015},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:38.913563Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:cb2bcd4f89c387582bec570494e128a80226dcc8cc836b480c6ff3e699a462f8","observation_id":"6ee465db-8c59-4529-82d2-34a60ff074f9","resolution":{"observed_at":"2026-08-05T22:58:44.133064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-04T09:31:34.784365Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14100","snapshot_observed_at":"2026-08-05T22:58:39.078760Z","title":"Git: A generative image-to-text transformer for vision and language","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:39.078760Z"},"links":{"cited_paper":"/paper/2205.14100","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:ce1b8f6ed3c9428a094535d8f2bc8bb6d24511ab0d20830477d3881529bc19c6","observation_id":"c70be9ec-30c4-4eca-90c2-f4446829c581","resolution":{"observed_at":"2026-08-05T22:58:39.078760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T22:58:39.203557Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:39.203557Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:ddacc3244c0dd00270444931687617f1feb848cb5e6d3635ff68a8a64c2a330d","observation_id":"cb6864a9-ffa5-41ed-82a0-34c08ddeb147","resolution":{"observed_at":"2026-08-05T22:58:39.203557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02677","last_updated":"2023-07-06T13:47:21Z","snapshot_observed_at":"2026-08-10T19:28:39.434196Z","submitted_at":"2023-05-04T09:48:22Z","title":"Caption Anything: Interactive Image Description with Diverse Multimodal Controls","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02677","snapshot_observed_at":"2026-08-05T22:58:39.332921Z","title":"Caption anything: Interactive image description with diverse multi- modal controls","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:39.332921Z"},"links":{"cited_paper":"/paper/2305.02677","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:49af09cc1e4508ed06a545096ec109b674c0de516a91a829dfb1593986c25645","observation_id":"50de6f54-467d-4a06-8f6c-716158020434","resolution":{"observed_at":"2026-08-05T22:58:39.332921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-05T22:58:39.456853Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:39.456853Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:0e864b1d4195e0de439db2790b9787fc0f3e48d2c7bdf294f5fb704fc2f5febe","observation_id":"2a05045c-dd8d-48e8-8b85-dbd2e8d22b01","resolution":{"observed_at":"2026-08-05T22:58:39.456853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00053","last_updated":"2022-10-31T18:09:51Z","snapshot_observed_at":"2026-07-06T14:12:45.730577Z","submitted_at":"2022-10-31T18:09:51Z","title":"Generating Sequences by Learning to Self-Correct","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00053","snapshot_observed_at":"2026-08-05T22:58:39.580049Z","title":"Gener- ating sequences by learning to self-correct","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:39.580049Z"},"links":{"cited_paper":"/paper/2211.00053","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:403cdfbf3c83706bf6ca35118e74a2ef4a1f1378e1b5f6c0b1cbc56c789fbb1a","observation_id":"a0a86057-9ea6-4940-a317-98ab80e2f66f","resolution":{"observed_at":"2026-08-05T22:58:39.580049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:43.694156Z","title":"Painting with words: Elevating detailed image cap- tioning with benchmark and alignment learning","venue":null,"work_id":"bc259be0-a6e4-4580-b87a-89b7607f42bd","year":2025},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:39.717372Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:21e6f966e6d39d6a19e38190a16b9f3cb8791e007ec832cd08a02698018ff93e","observation_id":"5ce173ae-a26d-4bbe-821d-8178f49ad673","resolution":{"observed_at":"2026-08-05T22:58:43.799450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:43.419509Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descrip- tions","venue":null,"work_id":"411ad18d-44b7-468c-897e-9c66e7740153","year":2014},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:39.861379Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:c0194aa73788c8937bb650e2111029bb2e327344309851d5de5d2a3297653b86","observation_id":"06973013-4ceb-4e65-9981-10885271bcc2","resolution":{"observed_at":"2026-08-05T22:58:43.538357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03916","last_updated":"2025-04-09T16:27:02Z","snapshot_observed_at":"2026-08-10T21:41:59.047406Z","submitted_at":"2025-01-07T16:31:10Z","title":"Dolphin: Moving Towards Closed-loop Auto-research through Thinking, Practice, and Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03916","snapshot_observed_at":"2026-08-05T22:58:39.953810Z","title":"Dolphin: Moving towards closed-loop auto- research through thinking, practice, and feedback","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:39.953810Z"},"links":{"cited_paper":"/paper/2501.03916","citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:5718de333568cb558295ad2322950293d4ac3de58f2f5355d09fc8920d357013","observation_id":"286c0451-cefe-417d-b5b2-539ff841a4cc","resolution":{"observed_at":"2026-08-05T22:58:39.953810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:43.212482Z","title":"Llamafac- tory: Unified efficient fine-tuning of 100+ language mod- els","venue":null,"work_id":"57b8ed78-bd7f-4699-85f8-4fd7e8170dd9","year":2024},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:40.076459Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:d250cfe80081d3f24e9f141efc6afd34bb964f2580b39c46f4f2666df17de189","observation_id":"a4143063-826d-4d87-8f4b-d3928d2c9a17","resolution":{"observed_at":"2026-08-05T22:58:43.308003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:42.976172Z","title":"For relation evaluation, we prompt open-source language models to answer the given questions based on the candi- date captions","venue":null,"work_id":"4f71c42a-10e0-43eb-a182-977b7b7d4682","year":null},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:40.202037Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:c5da413cb65879187a761d4f0e20099856b6a25dbca60911946b06eedffe2143","observation_id":"f019cea8-0459-4f92-9edc-ef2aa042c1d1","resolution":{"observed_at":"2026-08-05T22:58:43.061158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:42.772055Z","title":"We randomly select 100 images in DOCCI500 and ask 4 hu- man annotators to sort the captions provided by 4 differ- ent models, while considering both precision and recall","venue":null,"work_id":"2a4896a1-dd1e-4ce9-9dbe-a3bd14ad0239","year":null},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:40.354135Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:37fee4ded94dfd7e0bc1303744f9aeadb464982cf0ceb0b93eff8cddfbedb2d2","observation_id":"428c3552-a994-4ef9-81e8-7a21593a6f4d","resolution":{"observed_at":"2026-08-05T22:58:42.872936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:42.570622Z","title":null,"venue":null,"work_id":"7282f9d4-e5de-426e-87d9-0a894e39ab99","year":null},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:40.453530Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:2309277d366697680496a311349dcdbce4bd376750e18756791b071e3152d3ba","observation_id":"c2004cf0-d76e-4d56-98cf-8b8a7def2239","resolution":{"observed_at":"2026-08-05T22:58:42.675978Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:42.292171Z","title":"Same-Domain","venue":null,"work_id":"739b82b3-01d1-4b2f-9f9e-e11ddae5785f","year":null},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:40.599848Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:7033228554d1973c921aa4a099b318330c7652bc7cae997806403400ebf9748b","observation_id":"fda26ee6-9fde-4241-a578-41c2aa1e3087","resolution":{"observed_at":"2026-08-05T22:58:42.425937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:41.997960Z","title":null,"venue":null,"work_id":"f8e8f68c-8a08-4cf1-9d9e-edab2259563f","year":null},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:40.739659Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:3a6f454e5cf5c3543dfceae3f8e077b1aa7d11b4f13087701460e1e3f3752291","observation_id":"735b9408-4ed1-4bcf-a845-1b810bb084be","resolution":{"observed_at":"2026-08-05T22:58:42.154224Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:58:41.785555Z","title":"Because the training process includ- ing generating annotations for two rounds, the training time is relatively long","venue":null,"work_id":"63e51a03-3772-4275-a814-f72658d108f8","year":null},"citing_paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T22:58:40.901060Z"},"links":{"citing_paper":"/paper/2508.06125"},"observation_digest":"sha256:2f89411efeb9b3f3168a0e8a591ff1cf367e03d143e78f9b8282382e553869e1","observation_id":"66ef2bd3-43ed-49b6-8f6b-afe224ba9a46","resolution":{"observed_at":"2026-08-05T22:58:41.900996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.06125","last_updated":"2025-08-08T08:45:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T23:11:21.116180Z","submitted_at":"2025-08-08T08:45:52Z","title":"SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":2,"verified_fuzzy":27},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 2 inbound Pith citation observations for arXiv:2508.06125."}