{"as_of":"2026-08-06T18:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e0e4042f0c0aaf5b03a40989ce609860ef02904ce77429a0101ae36de5ce0440","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T17:57:47.409741Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.20278/citation-record","integrity":"/paper/2605.20278/integrity","json":"/paper/2605.20278/citation-record.json","paper":"/paper/2605.20278"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1607.08822","last_updated":"2016-07-29T14:26:27Z","snapshot_observed_at":"2026-07-06T05:05:22.910483Z","submitted_at":"2016-07-29T14:26:27Z","title":"SPICE: Semantic Propositional Image Caption Evaluation","version":1},"cited_work":{"arxiv_id":"1607.08822","doi":null,"metadata_source":"pith","pith_arxiv_id":"1607.08822","snapshot_observed_at":"2026-07-04T19:50:10.147535Z","title":"SPICE: Semantic Propositional Image Caption Evaluation","venue":"cs.CV","work_id":"fbb78edd-b514-4e29-b58c-40a29d893c92","year":2016},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"cited_paper":"/paper/1607.08822","citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:f77ce01f441f73258015bb402bc8ddf9bbcebc8b053ccd0ce8170a367b2d5cb5","observation_id":"202b597d-3aaf-4a2b-a1e1-ba64a0e7b169","resolution":{"observed_at":"2026-06-30T18:04:58.328227Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:2655116566ea2e3cecc9edabd30b2e9ffad499f78b60cc1cfbdd8d29217dfcb6","observation_id":"164d6e08-f470-49df-8dd9-c0388e2b5717","resolution":{"observed_at":"2026-06-30T18:04:58.322968Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.862010Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments","venue":null,"work_id":"9a34bdb8-01a8-405a-bf23-a46a13bf5a58","year":2005},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:5447bff4e03af864125a1428909c38bc235b388e19c6b67c31e1c9c61bdb20d1","observation_id":"d5969fc1-a13b-4b36-b50b-58ba14c051dd","resolution":{"observed_at":"2026-07-08T06:44:40.863740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12971","last_updated":"2023-10-19T17:59:01Z","snapshot_observed_at":"2026-07-06T16:35:48.413898Z","submitted_at":"2023-10-19T17:59:01Z","title":"CLAIR: Evaluating Image Captions with Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.12971","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.12971","snapshot_observed_at":"2026-06-30T18:04:58.324326Z","title":"Clair: Evaluating image captions with large language models","venue":null,"work_id":"d5165860-1333-4230-97a6-f2971212e4b1","year":2023},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"cited_paper":"/paper/2310.12971","citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:e5f38029ddba98911e1b3680c7fd3470acd221195c5f3985db0988973345123f","observation_id":"cb6a31f9-1896-4b26-b5ed-1b1f5a00630f","resolution":{"observed_at":"2026-06-30T18:04:58.325835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.819622Z","title":"Simplevqa: Multimodal factuality evaluation for multimodal large language models.2025 IEEE/CVF International Conference on Computer Vision (ICCV), pages 4637–4646","venue":null,"work_id":"b41df744-576d-4ae5-91ac-5abb17addeea","year":2025},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:c0c8868b1233020fe01ce2033aae7a2a2a0caea16710ef5a07dd1ab913d246d6","observation_id":"85767527-49cc-4d97-b275-de06a3520f70","resolution":{"observed_at":"2026-07-08T06:44:40.821858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":"2405.19092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-07-03T22:49:01.206350Z","title":"Benchmarking and improving detail image caption.ArXiv, abs/2405.19092","venue":null,"work_id":"23572c67-da01-476d-81cb-42e68cbc3817","year":2025},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:4e2550815dabbfa270d564022a270256bad1c0af8f426015a4e5f7507cd45419","observation_id":"01a168a1-f316-41bb-815b-d6fce0b9e254","resolution":{"observed_at":"2026-06-30T18:04:58.330839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-02T18:54:27.250149Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":"2501.00321","doi":"10.48550/arxiv.2501.00321","metadata_source":"pith","pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","venue":"cs.CV","work_id":"58bef901-2b24-42dd-9edc-28c0b2148490","year":2024},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:e5f4b6354bdcb68a5679ad349f198490262709f92bf91de648bf4b721e20039c","observation_id":"2c7155a6-e2c7-4136-89cb-c535243115f1","resolution":{"observed_at":"2026-06-30T18:04:58.316832Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:bfbec31c3eca085cd7b5086c7e2da652be73c618ccc08ad79fd1b2a069ee6af9","observation_id":"b280e90a-091a-4308-a785-3ce2c8c263d9","resolution":{"observed_at":"2026-06-30T18:04:58.341972Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14108","last_updated":"2023-10-20T17:01:44Z","snapshot_observed_at":"2026-07-06T15:20:41.322682Z","submitted_at":"2023-04-27T11:37:18Z","title":"DataComp: In search of the next generation of multimodal datasets","version":5},"cited_work":{"arxiv_id":"2304.14108","doi":"10.48550/arxiv.2304.14108","metadata_source":"arxiv_reference","pith_arxiv_id":"2304.14108","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Datacomp: In search of the next generation of multimodal datasets","venue":"arXiv (Cornell University)","work_id":"a309097d-9350-42a1-9232-7b765166f2da","year":2023},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"cited_paper":"/paper/2304.14108","citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:c805abc68aa1d5e178ac754f5ac6deadd946e70ef359b13f44bd16561b5b876b","observation_id":"cc80062b-c6f6-46c5-be8d-15b48b4c6989","resolution":{"observed_at":"2026-06-30T18:04:58.323685Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.814335Z","title":null,"venue":null,"work_id":"ed781b5d-d911-4094-8c38-3b44175241d7","year":2024},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:5edf9af08f07ecfd06f8f72c84d26ebc2ad8bb76cf737269b2be6dd92cb8cd19","observation_id":"e8527aef-a42b-4e14-bd4e-8a0d96871f3a","resolution":{"observed_at":"2026-07-08T06:44:40.816420Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":"2104.08718","doi":"10.48550/arxiv.2104.08718","metadata_source":"pith","pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","venue":"cs.CV","work_id":"2dd7e0b7-c69c-4976-a406-12d4f5b18d14","year":2021},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:ef02d59cfe30fc1ec2c6f00dbdbc9a97852b12a157b272fe159a05e1c77dd33a","observation_id":"33398531-6074-4991-b97c-3551cf8118f2","resolution":{"observed_at":"2026-06-30T18:04:58.339542Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14867","last_updated":"2024-06-03T16:59:20Z","snapshot_observed_at":"2026-07-06T17:07:14.412645Z","submitted_at":"2023-12-22T17:45:19Z","title":"VIEScore: Towards Explainable Metrics for Conditional Image Synthesis Evaluation","version":2},"cited_work":{"arxiv_id":"2312.14867","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.14867","snapshot_observed_at":"2026-07-04T12:59:52.750964Z","title":"Ku, Dongfu Jiang, Cong Wei, Xiang Yue, and Wenhu Chen","venue":null,"work_id":"938da770-47a0-42c7-9360-ee368ef1de59","year":2024},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"cited_paper":"/paper/2312.14867","citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:6e10b8a3391352dbacd9b0aa6a66103726606017bc9fcb53647691a5f6130b59","observation_id":"1d5ead44-912d-415a-9ff1-b58cfc52d902","resolution":{"observed_at":"2026-06-30T18:04:58.344776Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.832017Z","title":"Prometheus- vision: Vision-language model as a judge for fine-grained evaluation","venue":null,"work_id":"942861f9-ae53-4da4-88a9-8d55546cec81","year":2024},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:7c2421c8d54915d312cd49d069729de777b89627483c8e2880012f4bbe6c2b3f","observation_id":"b771662a-7a68-4334-82be-da0249707b07","resolution":{"observed_at":"2026-07-08T06:44:40.833705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.838538Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"a826687f-038f-4976-8223-a92f96d47686","year":2023},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:6b41a94c5242896df1b784c1c7af1f1a787a4a58c274d774d0ea14da137becb3","observation_id":"ec678de2-6e99-4496-b25e-4ea439317eac","resolution":{"observed_at":"2026-07-08T06:44:40.840321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16072","last_updated":"2025-04-22T17:51:41Z","snapshot_observed_at":"2026-07-06T21:13:09.093282Z","submitted_at":"2025-04-22T17:51:41Z","title":"Describe Anything: Detailed Localized Image and Video Captioning","version":1},"cited_work":{"arxiv_id":"2504.16072","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.16072","snapshot_observed_at":"2026-07-07T16:03:57.317950Z","title":"Describe anything: Detailed localized image and video captioning.ArXiv, abs/2504.16072","venue":"cs.CV","work_id":"855b8d4f-6054-459d-8a73-40538eb946ac","year":2025},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"cited_paper":"/paper/2504.16072","citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:5e882749dfb2a60960b0c1eec0d0ea76fdf4ad6059c9be62d17ff288b1e127e0","observation_id":"0258ed1f-f829-4ffb-8b77-265bda24120a","resolution":{"observed_at":"2026-06-30T18:04:58.306030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.794526Z","title":"Capability: A comprehensive visual caption benchmark for evaluating both correctness and thoroughness","venue":null,"work_id":"a7bcb85c-37e5-4961-89b7-2c0cd9ffabe0","year":2025},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:39e7361914283217fa6d9a0227520ac7121af7b7bf7cbd33195fcb88fc72f0d3","observation_id":"e535b3bf-6bd4-4b87-90a9-2a5aa3d8087f","resolution":{"observed_at":"2026-07-08T06:44:40.796583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":"2203.02155","doi":"10.1007/s00354-022-00198-8","metadata_source":"pith","pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training language models to follow instructions with human feedback","venue":"cs.CL","work_id":"52aff42f-4fa9-4fcf-bdb3-1459b9bebf65","year":2022},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:cd6167402e58a3906aa5e97b119a6d49bb318f002084cd42775189d4b31e842c","observation_id":"5a921b0b-c5c9-40a2-b73a-66146222511e","resolution":{"observed_at":"2026-06-30T18:04:58.328638Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.821613Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"7c449c58-f77b-4ec2-ac8d-79cd00596ff9","year":2002},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:a100f90908cd2c85969ca2014f1d45fc8bd6a40a14e100769729c7080d7073db","observation_id":"ac60f457-c5f4-4484-a788-20441bb6f57e","resolution":{"observed_at":"2026-07-08T06:44:40.823012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":"2305.18290","doi":"10.48550/arxiv.2305.18290","metadata_source":"pith","pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","venue":"cs.LG","work_id":"62105b61-411f-46e5-970a-bd322c6adbbc","year":2023},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:a0d2171eb33b27aa3fdccace504dde9ff1271ed71e302493f589e350506f3962","observation_id":"f326c86f-c7ea-4f6f-b2ee-9ea29065b9f5","resolution":{"observed_at":"2026-06-30T18:04:58.336874Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-21T13:53:49.179087+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T13:53:49.179087+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.817231Z","title":"Rennie, Etienne Marcheret, Youssef Mroueh, Jarret Ross, and Vaibhava Goel","venue":null,"work_id":"4ea86430-c9c7-4c52-b749-5dd5f84f2952","year":2017},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:27a29e0f1b9e5863087b9caeda1ad9ef479a6d831c7fba981de91fdc13b24b06","observation_id":"5e2ffbba-33e4-4ab9-83ed-2cab41ff948f","resolution":{"observed_at":"2026-07-08T06:44:40.818871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.791513Z","title":"Object hallucination in image captioning","venue":null,"work_id":"5de9a377-ef70-49bd-8439-04173de3c00f","year":2018},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:bc589f6b0c7ae0e98cd4cb8a457335ce34f8a5b43cc12c08eafab176b9a1290b","observation_id":"477a2f88-8086-4b5a-a52d-a13134a89063","resolution":{"observed_at":"2026-07-08T06:44:40.793572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.822784Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"768efb60-35bb-4908-accc-29c85b034050","year":2022},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:eb8fa28ee675cbe19f4dccefc390296164b7d9a05454c3307143b65f41eff4f6","observation_id":"890af3bf-eaf9-49db-a635-fbd3ca5f14f7","resolution":{"observed_at":"2026-07-08T06:44:40.824504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:ca1f8d308ab9a5e7894df1b8736c88eb5c3ea7a571516729e95064f573462f9c","observation_id":"3c368f15-bf23-4746-b2ba-c99d14459c07","resolution":{"observed_at":"2026-06-30T18:04:58.326219Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.805396Z","title":null,"venue":null,"work_id":"9b75bbeb-114c-48c3-b210-089bad354e1d","year":2026},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:b996b3f7339726f0aac29483345a429103c3fd017460bbb7f9eaa5ad43ee5618","observation_id":"9a919184-911f-4f75-b596-cff3a269ae64","resolution":{"observed_at":"2026-07-08T06:44:40.807066Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":"2309.14525","doi":"10.48550/arxiv.2309.14525","metadata_source":"pith","pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","venue":"cs.CV","work_id":"85bf563b-4790-4f8d-92e3-0ed210813c10","year":2023},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:2edcb894c4adf3986a00525003c7b6305c7f65a9a991412d79dd323221bdd915","observation_id":"497e6852-f409-4cf6-88f2-77ef7d44cbdd","resolution":{"observed_at":"2026-06-30T18:04:58.347388Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:21:08.282214+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:21:08.282214+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.811474Z","title":null,"venue":null,"work_id":"9c4c2d8d-ba9b-4588-b875-afe91ad88fd9","year":2025},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:2d81f4f1d14839103f50607aa055e2c352e87b04db1a2ae7ad47f5875432d74a","observation_id":"fc3499c6-148d-44f5-a8d0-5b8a641f26bb","resolution":{"observed_at":"2026-07-08T06:44:40.813496Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.809058Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"3cef06f0-def2-46c3-8bdc-fcb5bc791087","year":2015},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:12a397108cbfd75dc7524e1f7096eb8896b05deddb719216cf507b45b700c7f7","observation_id":"5b7ac8b4-3ce2-40fe-8706-c2bcbf3cf0c9","resolution":{"observed_at":"2026-07-08T06:44:40.810687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.18876","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T00:49:18.029670Z","title":"Grasp any region: Towards precise, contextual pixel understanding for multimodal llms.ArXiv, abs/2510.18876","venue":null,"work_id":"ff0a6d2e-bec1-49c2-bf6d-e3ee4a836026","year":2025},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:5aee2fe7ab91e448d52e12221f782d4d78273be0e261c176180b62062c57c8ff","observation_id":"23609eb5-ccdf-4b80-8646-33284dee9746","resolution":{"observed_at":"2026-06-30T18:04:58.350347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15556","last_updated":"2024-08-28T06:09:02Z","snapshot_observed_at":"2026-07-06T19:06:58.753073Z","submitted_at":"2024-08-28T06:09:02Z","title":"Divide, Conquer and Combine: A Training-Free Framework for High-Resolution Image Perception in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2408.15556","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.15556","snapshot_observed_at":"2026-07-02T11:46:55.941528Z","title":"Divide, conquer and combine: A training-free framework for high-resolution image perception in multimodal large language models.ArXiv, abs/2408.15556","venue":null,"work_id":"7adc792d-ad50-416b-bcf0-d9c6a0b622c7","year":2024},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"cited_paper":"/paper/2408.15556","citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:d69c5488ab9782b5ffb6151c6f33b13c317a1df710a2fd4dff7995c80592779d","observation_id":"f5651ffc-427a-40e7-877f-47917c8181a4","resolution":{"observed_at":"2026-06-30T18:04:58.341749Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.847180Z","title":"Vicrit: A verifiable reinforcement learning proxy task for visual perception in vlms","venue":null,"work_id":"29d601a2-5ea4-4132-bb9e-fe5325cf3512","year":2025},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:172eefa4de9548fc62b6e4cd85ffa9978fb3c0ddd0d539b17899bb4fc6a85f07","observation_id":"3bc28391-656a-4359-b517-46c94055bba6","resolution":{"observed_at":"2026-07-08T06:44:40.849294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.866903Z","title":"Realworldqa","venue":null,"work_id":"3ad9d6dc-5c92-45e1-81de-2ee15784881a","year":2024},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:bd70143d98fa481de1a0b51b40c0a6afe1ca8a06774a726af808e683d96bb29e","observation_id":"4a2adb6e-e098-4fc4-a0c6-eae351e5f508","resolution":{"observed_at":"2026-07-08T06:44:40.868803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.835866Z","title":"Caprl: Stimulating dense image caption capabilities via reinforcement learning","venue":null,"work_id":"684bcbd7-1e4b-40be-9ce3-72f5300ddb14","year":2025},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:2839b7221533dce11c8b173ddd1f8c5310d0cb28447f46f4cde1967be35353eb","observation_id":"f5cfb4a4-bb06-483d-825a-2f36eedf8620","resolution":{"observed_at":"2026-07-08T06:44:40.838788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21025","last_updated":"2026-04-15T22:38:59Z","snapshot_observed_at":"2026-08-02T04:56:59.957039Z","submitted_at":"2025-11-26T03:43:32Z","title":"CaptionQA: Is Your Caption as Useful as the Image Itself?","version":2},"cited_work":{"arxiv_id":"2511.21025","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.21025","snapshot_observed_at":"2026-06-30T18:04:58.334840Z","title":"CaptionQA: Is Your Caption as Useful as the Image Itself?","venue":"cs.CV","work_id":"b5adf35e-0eb4-4ac8-baa8-7f59b9103add","year":2025},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"cited_paper":"/paper/2511.21025","citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:e8ddb35c9dfc2f9c3de895542b705a463b1b1283c67d0ca3b52c2b5090ac72b7","observation_id":"41943c0c-0556-415c-a68b-4f9e3379d8a3","resolution":{"observed_at":"2026-06-30T18:04:58.336063Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.849737Z","title":"Sc-captioner: Improving image captioning with self-correction by reinforcement learning","venue":null,"work_id":"004cd108-d04d-432b-bfca-6156333e2a90","year":2025},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:00d06e3562a1fca1950de5d7c94de2a581d34bc3936b6d769ca12d4cea7bfa7a","observation_id":"cf9e781d-3689-4981-85ce-7589f9d91bf6","resolution":{"observed_at":"2026-07-08T06:44:40.851512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.852259Z","title":"Please describe this 18 image in detail","venue":null,"work_id":"e9139ba6-9b8b-435d-a6e9-114dc82cd627","year":2025},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:e9780815e6aba2922f79630a55011b2d345ac5cb7b26aa077605db0b465ad0c1","observation_id":"b675ee7c-31ab-47da-8984-70f9b25599a6","resolution":{"observed_at":"2026-07-08T06:44:40.854116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.857326Z","title":"Important rules: - A correct detail in the actor caption should not be penalized merely because it is absent from the reference","venue":null,"work_id":"d61b96f4-00e3-4fc4-b7fd-217736579549","year":null},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:0f382c9ac77612a045f83daf10538796963b2f40e2eb08cb4c4cef3a580b62e4","observation_id":"360a0039-0231-450e-a164-63d966dc384b","resolution":{"observed_at":"2026-07-08T06:44:40.858879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.845102Z","title":null,"venue":null,"work_id":"3d9e7ceb-aeeb-460e-9981-7fec54290645","year":null},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:1a74b0277b18aded997b58b78e85d53769aef6711934a91d83f943c883e498a6","observation_id":"2629b8ea-2788-4f68-ac03-0b63bdfc5004","resolution":{"observed_at":"2026-07-08T06:44:40.846727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.847544Z","title":null,"venue":null,"work_id":"a38a2179-1ea3-4489-a535-097d9f2f4c52","year":null},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:ad922116f315e02fd6de3d4fd754d4b63e5c843b18443725d2850f498e6440c8","observation_id":"5c3f46b1-39af-4e9e-8f7f-ec20ed4d3080","resolution":{"observed_at":"2026-07-08T06:44:40.849050Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.854938Z","title":null,"venue":null,"work_id":"eab42693-05b4-41ba-a18b-fc4b7b8dd6f7","year":null},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:72922a902a1f8a1ffcd81f94282801a3e0ef211c9c3b53c79b84a8bca5c86a36","observation_id":"6c8ba550-db97-4844-bf03-6a5359cd3cd6","resolution":{"observed_at":"2026-07-08T06:44:40.856579Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.842747Z","title":null,"venue":null,"work_id":"2d906fd2-902f-4f62-ba05-0c36df391586","year":null},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:989fd6526a6f63d67db275df5b97cf14c96e004526d6d60d55fddae145292690","observation_id":"bea42471-b43a-46ab-88e8-8ebaac4b82b2","resolution":{"observed_at":"2026-07-08T06:44:40.844257Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.864534Z","title":"Important rules: - Penalize hallucination more than omission","venue":null,"work_id":"696f6841-4bd7-442c-9021-17fec0dffc67","year":null},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:c7400d07d40c254d0fcffc78fb387049910530263b7e644f7a0e2470a966d833","observation_id":"b4f1c1d0-305a-4b00-ac77-1f1c5ab34474","resolution":{"observed_at":"2026-07-08T06:44:40.866027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.872780Z","title":"A contradiction is a candidate claim that conflicts with the reference","venue":null,"work_id":"5b11893b-fdb9-4caf-aac1-74f5580e8ca3","year":null},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:32b2b8106729bdc449f480bc9ba64cdb71bd00fc09a2c248feafc56b39bb4af4","observation_id":"22912e29-8dba-443e-aedf-1ee9104a1d55","resolution":{"observed_at":"2026-07-08T06:44:40.874624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.843871Z","title":"missing\" and is_hallucination=false Strict mapping rules for is_hallucination: - type=","venue":null,"work_id":"e724a4c1-5393-427d-8e02-854a3c1520c0","year":null},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:8ff1f4c16f68432c63fad0caf9cb5878436aed380b2930d692e86fbe3d21df95","observation_id":"73a9e897-14fe-4b70-91c7-cc3d2f63d527","resolution":{"observed_at":"2026-07-08T06:44:40.845935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.833555Z","title":null,"venue":null,"work_id":"dfeaf4bf-0b8a-4861-a9d2-653f5d50280e","year":null},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:cbf983e7e83b7f250dadae4c76ca2327cf0fa667b9c5856fcb19c61a14b03d69","observation_id":"0b646652-8957-455d-aadc-ae93c556291e","resolution":{"observed_at":"2026-07-08T06:44:40.835033Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.839621Z","title":null,"venue":null,"work_id":"03ea98e7-de16-493d-a175-aca055a04a81","year":null},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:3a65d363546951b45bbefb7164b29a7e33d89c919a108c4bbd4591bf6a50c3e9","observation_id":"a32f7731-a9f5-4357-92ba-0511daca04ab","resolution":{"observed_at":"2026-07-08T06:44:40.841705Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.875378Z","title":null,"venue":null,"work_id":"7ea217dc-4702-40ec-85d3-2d1051801dbe","year":null},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:fa8ae60081413c6588f80f5465eded9f33804d1917e554191d6edc39295c8e92","observation_id":"fcaa91af-7613-40ec-ba4c-421c1779e95d","resolution":{"observed_at":"2026-07-08T06:44:40.876872Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.859562Z","title":null,"venue":null,"work_id":"f606c377-2dc4-4357-89de-258372ce572f","year":null},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:da26d384428fa5968fbfca06cc197e86ae24ac001b4d4e8e90f87fdb32a5474e","observation_id":"e9b7f836-959c-41ba-bba0-89d14d1f8d39","resolution":{"observed_at":"2026-07-08T06:44:40.861105Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.869699Z","title":null,"venue":null,"work_id":"80204436-7d9d-4335-a4cb-7666e24f5413","year":null},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:634b57a71522b71673650f58b48802eebe57b0d5aaa15291cce1b4c4b7ed9cb2","observation_id":"8910c7f5-d178-4a79-8fa3-c2fd74224fb5","resolution":{"observed_at":"2026-07-08T06:44:40.871663Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T06:44:40.828503Z","title":null,"venue":null,"work_id":"83ee5837-3365-49a0-996d-a4f345f0eeb0","year":null},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:414e9d00e5dd6d098a414a79a683b940acdf4b74625eb5aaeb06d214c07f2cbe","observation_id":"1e0f0f2b-fd64-4f0c-802e-0f288db7db3c","resolution":{"observed_at":"2026-07-08T06:44:40.829938Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4800.5372","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T18:04:58.337435Z","title":"claims\": [ {","venue":null,"work_id":"1e610785-cb76-4969-bcb9-edd550ef51d0","year":2030},"citing_paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-30T17:57:47.409741Z"},"links":{"citing_paper":"/paper/2605.20278"},"observation_digest":"sha256:139dd4418757dd8f3b88b36a5b5f98e4a41f00e1fbe3520641758f39e4c7e4a5","observation_id":"2ec98524-8838-4b6b-895e-705ab8a2ef56","resolution":{"observed_at":"2026-06-30T18:04:58.338821Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.20278","last_updated":"2026-05-24T12:22:09Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:30:53.900592Z","submitted_at":"2026-05-19T04:39:28Z","title":"ClaimDiff-RL: Fine-Grained Caption Reinforcement Learning through Visual Claim Comparison"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":13,"verified_exact":15,"verified_fuzzy":19},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2605.20278."}