{"as_of":"2026-08-08T01:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eba30d953ef945a01d7132ba06a1934eed4eb3992b9c4b8a031a02c322e47ffa","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:08:08.869281Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.22613/citation-record","integrity":"/paper/2505.22613/integrity","json":"/paper/2505.22613/citation-record.json","paper":"/paper/2505.22613"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-07T13:08:02.224914Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:02.224914Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:923f2d51d505d177017828121fa97c6d4b7a143f113d98a4168b67be73feb895","observation_id":"90463c61-bf5e-443d-8851-0b8611e30f46","resolution":{"observed_at":"2026-08-07T13:08:02.224914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.08822","last_updated":"2016-07-29T14:26:27Z","snapshot_observed_at":"2026-07-06T05:05:22.910483Z","submitted_at":"2016-07-29T14:26:27Z","title":"SPICE: Semantic Propositional Image Caption Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.08822","snapshot_observed_at":"2026-08-07T13:08:02.296549Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:02.296549Z"},"links":{"cited_paper":"/paper/1607.08822","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:6250946b0f2e94f233cf8ee9aa92f4c8d7c1e67de5e69c0ca03f6a3df75a2e31","observation_id":"dc5ff3fa-1c18-47dd-b333-692732d69e67","resolution":{"observed_at":"2026-08-07T13:08:02.296549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T13:08:02.411249Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:02.411249Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:707aee22f2f225b70b9328a87ec7a836f208f5cccb6c3faf5feb89504783db1c","observation_id":"714fbf1d-f07e-4025-aea3-127cae2dfbc4","resolution":{"observed_at":"2026-08-07T13:08:02.411249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T13:08:02.514104Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:02.514104Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:48926f50eedc07e08bfae51b426aef592a9ddc344ec426c2dff229802fde29a7","observation_id":"dc6bcb00-ea6c-45ef-a8e1-9e2c5364cc79","resolution":{"observed_at":"2026-08-07T13:08:02.514104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18930","snapshot_observed_at":"2026-08-07T13:08:02.609812Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:02.609812Z"},"links":{"cited_paper":"/paper/2404.18930","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:6ae1d7a35d9d6eb860af77b6a360c24b6a32b8fd6bbb58e0f468fe0ac9017af6","observation_id":"e803da03-b8c5-45fa-9602-7b9c93be180c","resolution":{"observed_at":"2026-08-07T13:08:02.609812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:10.247900Z","title":null,"venue":null,"work_id":"0b8f13e7-5c9d-4497-8e11-5aec3fef8e2a","year":2023},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:02.710978Z"},"links":{"citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:938349b0c7fe3f0276cf98fd2d1eb052f5448cd905b3f80ec241e4aca3a01e78","observation_id":"e97fa7e0-4965-4cb8-8b22-5fc9a85af19b","resolution":{"observed_at":"2026-08-07T13:08:10.300178Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-07T13:08:02.797253Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:02.797253Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:60caaf00247dfecf1e79ff5bb764897408a3b3add9b3a163dfb2e22aa254c8da","observation_id":"e059b8d5-4d35-4768-99d0-84a0df065497","resolution":{"observed_at":"2026-08-07T13:08:02.797253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:02.914321Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:02.914321Z"},"links":{"citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:7cb9b6958823e8538ef704a4bfc02ff6f979c049fc571b4608e9394c8d8225f9","observation_id":"5cb60e30-a5c0-4049-9cb6-7d47de177c7f","resolution":{"observed_at":"2026-08-07T13:08:02.914321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T13:08:03.022462Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:03.022462Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:f7698630f62fd81a5a513046191ec000f353e388e59d7288cf63f3af3d545e04","observation_id":"ec6b558f-1628-4982-9668-2ca3c7f3a36b","resolution":{"observed_at":"2026-08-07T13:08:03.022462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-07-06T18:22:01.301152Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-08-07T13:08:03.153714Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:03.153714Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:96de7c9a8420b1ed5de7aedf0805778050efe50a2f5d9112dd7f863e72062c18","observation_id":"285fe182-3d78-4df4-860c-79512ddbfdd4","resolution":{"observed_at":"2026-08-07T13:08:03.153714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00234","last_updated":"2024-10-05T11:47:02Z","snapshot_observed_at":"2026-07-06T14:36:25.690733Z","submitted_at":"2022-12-31T15:57:09Z","title":"A Survey on In-context Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00234","snapshot_observed_at":"2026-08-07T13:08:03.233342Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:03.233342Z"},"links":{"cited_paper":"/paper/2301.00234","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:25b4866a00cad761ae1f463b8f76bd84927de51891b59ba127e5fcf05056cf10","observation_id":"93f5842e-428b-43d3-8fb6-f97863357a38","resolution":{"observed_at":"2026-08-07T13:08:03.233342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20088","last_updated":"2023-10-28T08:46:13Z","snapshot_observed_at":"2026-08-05T05:10:35.003635Z","submitted_at":"2023-05-31T17:59:04Z","title":"Improving CLIP Training with Language Rewrites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20088","snapshot_observed_at":"2026-08-07T13:08:03.303022Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:03.303022Z"},"links":{"cited_paper":"/paper/2305.20088","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:0715174f0b8942b9b6e64a80cecd89efed5a2f7e58fecb2950d0e77ac4953a90","observation_id":"a0697e11-d0e0-4a02-872b-e8111bb91916","resolution":{"observed_at":"2026-08-07T13:08:03.303022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:03.374847Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:03.374847Z"},"links":{"citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:3e7fcbf3c40299da6738c898e170d2e160f1cf773278086bef191b9fa9b384b2","observation_id":"e1c9293f-1173-4e62-b229-6156df03b9d9","resolution":{"observed_at":"2026-08-07T13:08:03.374847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11513","last_updated":"2023-10-17T18:20:03Z","snapshot_observed_at":"2026-07-06T16:34:42.650324Z","submitted_at":"2023-10-17T18:20:03Z","title":"GenEval: An Object-Focused Framework for Evaluating Text-to-Image Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11513","snapshot_observed_at":"2026-08-07T13:08:03.447542Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:03.447542Z"},"links":{"cited_paper":"/paper/2310.11513","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:50a23bfc471be0669570e49a568cf0723247c09851463b1d7d8d04b8cf4d93ec","observation_id":"e9b1095e-54f8-46ee-9570-65993b2f0c2d","resolution":{"observed_at":"2026-08-07T13:08:03.447542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-07T13:08:03.524335Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:03.524335Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:8b3d641b9c69818e067b82ec1a16db9fbbffd86a71948403ac1e1ae8dc9c788e","observation_id":"f17a7886-2c4c-4fc3-b881-22885e2569bc","resolution":{"observed_at":"2026-08-07T13:08:03.524335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-05T11:54:14.447608Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-07T13:08:03.626178Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:03.626178Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:1cf5f498efb8982f044fcd96f5a1531cf87bb344da99293115d5b9fe70e86fb2","observation_id":"a683d7db-d212-4e2f-92ee-460c5bb7e6bc","resolution":{"observed_at":"2026-08-07T13:08:03.626178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T13:08:03.741011Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:03.741011Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:1d354f95a6ab3753fe5bc07f9ca2fd3b1884cbc46eec72fa726e823c2ca286c1","observation_id":"8e721d09-db49-4d03-ad35-f21644d1adc5","resolution":{"observed_at":"2026-08-07T13:08:03.741011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-04T23:51:18.339338Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-07T13:08:03.841863Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:03.841863Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:bdc0f86d168826b5a5ffd522b49048b435357f711e802ad6e848a5123d819085","observation_id":"67873c65-c2b7-47b4-93ef-2441ad0781a2","resolution":{"observed_at":"2026-08-07T13:08:03.841863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-07-06T15:53:23.361639Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-07T13:08:03.913503Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:03.913503Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:67cd8be2270294094425d49aa75a53d0470ca8b98154ac0d05c6e30ae3c047ff","observation_id":"ab514049-398b-44d1-9f7b-4630afa36023","resolution":{"observed_at":"2026-08-07T13:08:03.913503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:03.998066Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:03.998066Z"},"links":{"citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:4528b2980ebb9ff000ca1327d0543c0731a75b0e0fec12a228501fb98ccaff94","observation_id":"65f33dcf-9ea4-497b-a508-52d258668a74","resolution":{"observed_at":"2026-08-07T13:08:03.998066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:04.091130Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:04.091130Z"},"links":{"citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:26545327efea1587cab1efab431240a4a089aafa29bd82f9d2f871d0c7bca3e8","observation_id":"9e7fa958-1490-4002-81da-fac08bbf48bf","resolution":{"observed_at":"2026-08-07T13:08:04.091130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07699","last_updated":"2024-03-13T22:27:08Z","snapshot_observed_at":"2026-08-07T22:28:20.122152Z","submitted_at":"2023-10-11T17:49:13Z","title":"VeCLIP: Improving CLIP Training via Visual-enriched Captions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07699","snapshot_observed_at":"2026-08-07T13:08:04.205365Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:04.205365Z"},"links":{"cited_paper":"/paper/2310.07699","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:ddb5b1a9212d57701e4759efe6e240666388f1b3d94c5623e63872019306380a","observation_id":"ae4bd084-619c-4959-a82d-421bd37155db","resolution":{"observed_at":"2026-08-07T13:08:04.205365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-07T13:08:04.303127Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:04.303127Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:2778c4a247727e8b502efd1cdc192e3fceea4745da627558c09f6979cf3cc476","observation_id":"4af59865-4ae8-42ba-a9c6-40fe3663865b","resolution":{"observed_at":"2026-08-07T13:08:04.303127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-02T08:01:43.194717Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-07T13:08:04.386112Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:04.386112Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:946c2fe3dbd8cfb16457bb90ba9e8196d8e4c96364e3c4829b58ea8495ccbd40","observation_id":"a14b41b1-eede-4c43-b21c-bf8d2717c0e5","resolution":{"observed_at":"2026-08-07T13:08:04.386112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17497","last_updated":"2023-06-01T04:56:26Z","snapshot_observed_at":"2026-08-02T04:26:22.991382Z","submitted_at":"2023-05-27T15:38:31Z","title":"FACTUAL: A Benchmark for Faithful and Consistent Textual Scene Graph Parsing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17497","snapshot_observed_at":"2026-08-07T13:08:04.479059Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:04.479059Z"},"links":{"cited_paper":"/paper/2305.17497","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:f0bedec61e4d1ddbcb994400c3177372e19fd237b76239026871b93a8b37e325","observation_id":"50aa06cf-5d1b-49a6-8515-95435e9fd6d2","resolution":{"observed_at":"2026-08-07T13:08:04.479059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:04.565373Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:04.565373Z"},"links":{"citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:783cf6cb66e3b4f3730a3223785b258ce702546dadc636703d83768c39391698","observation_id":"f82f29cd-725b-4492-89dd-b8a0c02d954b","resolution":{"observed_at":"2026-08-07T13:08:04.565373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01291","last_updated":"2024-06-18T07:09:55Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-04-01T17:58:06Z","title":"Evaluating Text-to-Visual Generation with Image-to-Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01291","snapshot_observed_at":"2026-08-07T13:08:04.662605Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:04.662605Z"},"links":{"cited_paper":"/paper/2404.01291","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:40b045fb06a4d1c5a1d72dc5978133e5df69283596255aff672a1f86b3b8489a","observation_id":"f79b9c52-9e3f-46e8-9e9a-96587df0c713","resolution":{"observed_at":"2026-08-07T13:08:04.662605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-07-06T19:16:23.103921Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-07T13:08:04.804019Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:04.804019Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:cdf368eea27a8ec91eb94fd0484cb7c74d91d240cb667a1f7459a5fc2c25a34b","observation_id":"25002f22-4f2d-4fbf-9222-f49370bb2c88","resolution":{"observed_at":"2026-08-07T13:08:04.804019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-07T13:08:04.893325Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:04.893325Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:6dce29d021acacbe3a8a27649bdbce37649d1040ff66e90e8af0158ebfe8dd56","observation_id":"27ef73e7-64f7-4ca8-92d9-a7a406674719","resolution":{"observed_at":"2026-08-07T13:08:04.893325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-07T13:08:05.034601Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:05.034601Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:57cacb4b4d47042404ceef14773cc9794f620b0497705aa2f84f707ee65c2902","observation_id":"f3c8e907-8dcc-4ff2-93ed-c5653997fe54","resolution":{"observed_at":"2026-08-07T13:08:05.034601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T13:08:05.189909Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:05.189909Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:8749d1b024f098fa1ffea176d3ea70e79f2cf7d9746036c5310c32cadd823479","observation_id":"35c61650-6da7-4968-a50d-1fe8be2d38ea","resolution":{"observed_at":"2026-08-07T13:08:05.189909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08614","last_updated":"2025-03-26T06:10:20Z","snapshot_observed_at":"2026-08-02T11:55:01.072868Z","submitted_at":"2024-12-11T18:37:42Z","title":"Benchmarking Large Vision-Language Models via Directed Scene Graph for Comprehensive Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08614","snapshot_observed_at":"2026-08-07T13:08:05.395780Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:05.395780Z"},"links":{"cited_paper":"/paper/2412.08614","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:12872458e13b5f8424d36777bd4b0bc34662faf60a36ff67ab78f09d0d143fbd","observation_id":"050d1fec-5a17-4cbb-a3dd-6661b90d05d4","resolution":{"observed_at":"2026-08-07T13:08:05.395780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T13:08:05.567642Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:05.567642Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:490fd111461c58f5b650d2480c3c890ecfcbe17fe2a91f00aa7e1bc760fe9641","observation_id":"7fbd89d8-0707-44bc-b076-3e5942c8d3fb","resolution":{"observed_at":"2026-08-07T13:08:05.567642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:05.741641Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:05.741641Z"},"links":{"citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:fba6e154785538dca7c774be4aa56e090f741d466e2952feb1d4513a640c9473","observation_id":"e12b594c-8055-4723-88d4-332c0e529590","resolution":{"observed_at":"2026-08-07T13:08:05.741641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-07T13:08:05.893497Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:05.893497Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:61edf805b1e00c5c7ca2e6dee27c9c756a1aa6e5a094ce6070e1b189cf4dbbfa","observation_id":"a1f97d57-0233-458c-8d8c-b6f5ad7bcb87","resolution":{"observed_at":"2026-08-07T13:08:05.893497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:06.015674Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:06.015674Z"},"links":{"citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:2edb767796f01bdc173ba3d15919a3063522182d3c3d61f2fc08f1bec776ec81","observation_id":"9e3b42fd-d060-407b-961f-0a91638baa29","resolution":{"observed_at":"2026-08-07T13:08:06.015674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06666","last_updated":"2025-04-09T08:07:46Z","snapshot_observed_at":"2026-08-07T16:07:16.363470Z","submitted_at":"2025-04-09T08:07:46Z","title":"Patch Matters: Training-free Fine-grained Image Caption Enhancement via Local Perception","version":1},"cited_work":{"arxiv_id":"2504.06666","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.06666","snapshot_observed_at":"2026-08-07T13:08:09.587647Z","title":"Patch Matters: Training-free Fine-grained Image Caption Enhancement via Local Perception","venue":"cs.CV","work_id":"c4bc3fb0-26cf-4fae-8813-aa2d215cd3c1","year":2025},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:06.136121Z"},"links":{"cited_paper":"/paper/2504.06666","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:05206e81843de72dd776e88f6a91c6f7cb56c25ced7afe5b78d7054aa29b91a9","observation_id":"f8243aab-30e4-4d78-8449-60e07b5b33d0","resolution":{"observed_at":"2026-08-07T13:08:09.657590Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:06.252023Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:06.252023Z"},"links":{"citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:55fc4915ed16f48beacc8c8d390d9a69a0c803619b88300a50bb6d67be7d9ecf","observation_id":"b96e1fe6-ade3-4e55-99f6-14941409d313","resolution":{"observed_at":"2026-08-07T13:08:06.252023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10683","last_updated":"2023-09-19T15:14:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-23T17:37:36Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10683","snapshot_observed_at":"2026-08-07T13:08:06.370126Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:06.370126Z"},"links":{"cited_paper":"/paper/1910.10683","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:33c4556b1dfe72d9b5c7347e2ab3b32524b14d06afb61edda19154977de26336","observation_id":"db01e3cc-8589-40c3-811e-42278e299bee","resolution":{"observed_at":"2026-08-07T13:08:06.370126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02051","last_updated":"2024-03-28T12:41:14Z","snapshot_observed_at":"2026-07-06T16:56:42.232555Z","submitted_at":"2023-12-04T17:09:52Z","title":"TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02051","snapshot_observed_at":"2026-08-07T13:08:06.501876Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:06.501876Z"},"links":{"cited_paper":"/paper/2312.02051","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:f53e437ac9912274c124e6689eff460a4d6db3fbaa42615f370633ed61067973","observation_id":"0bbf7527-2e0a-43dd-8862-846ec2812208","resolution":{"observed_at":"2026-08-07T13:08:06.501876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:06.641934Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:06.641934Z"},"links":{"citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:61daa2783aadb880e6871c4a42f580b3ae4125f5d9402889288b08dd4ac7caf8","observation_id":"b91d8922-fafe-4c54-8071-bc1d40044a68","resolution":{"observed_at":"2026-08-07T13:08:06.641934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T13:08:06.759252Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:06.759252Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:f9173131e05c623733aa4482acfad6e9981d99f465323022360a9712ca604156","observation_id":"a85e9afc-a2df-4d8a-9b1a-719b8539f95b","resolution":{"observed_at":"2026-08-07T13:08:06.759252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T13:08:06.905429Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:06.905429Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:8063ff9997aa178ab783160aeb6f20d3756d8f1f72bafb7e1ce6e7b50944c5ed","observation_id":"24b18474-4d6c-4d2b-a31f-3b23fe409bb8","resolution":{"observed_at":"2026-08-07T13:08:06.905429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T13:08:07.021522Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:07.021522Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:9aa4aca5020ccce2b3f90a3c58d8620729d9e3d2f1971f84cc01750ac48836a7","observation_id":"1fe5ad3a-fbac-417a-9cd5-dfb1c964319b","resolution":{"observed_at":"2026-08-07T13:08:07.021522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1411.5726","last_updated":"2015-06-03T01:42:20Z","snapshot_observed_at":"2026-08-07T17:52:59.562945Z","submitted_at":"2014-11-20T23:54:35Z","title":"CIDEr: Consensus-based Image Description Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.5726","snapshot_observed_at":"2026-08-07T13:08:07.125212Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:07.125212Z"},"links":{"cited_paper":"/paper/1411.5726","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:dd33e9a9af88f799c0cc804627ad50fb4f1675210448a755bda1eea51a2d9e02","observation_id":"1f58cc58-b22b-45a3-ad0c-4314b2fb9870","resolution":{"observed_at":"2026-08-07T13:08:07.125212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07397","last_updated":"2024-02-23T07:54:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-13T15:25:42Z","title":"AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07397","snapshot_observed_at":"2026-08-07T13:08:07.239579Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:07.239579Z"},"links":{"cited_paper":"/paper/2311.07397","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:2b9b3659be9fe09bbaa08d86090f3dfb249c5e5192c15109b3b08316eae38b9d","observation_id":"30f5fc9a-3a27-4395-af93-e472c428b700","resolution":{"observed_at":"2026-08-07T13:08:07.239579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T13:08:07.365190Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:07.365190Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:f313b27006b531d6cc61ccab072977a686d19f36538f658d31d5cbdf0f9e9b38","observation_id":"da252b43-a893-4478-abe5-2eb5a55d4d6e","resolution":{"observed_at":"2026-08-07T13:08:07.365190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-07T13:08:07.562423Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:07.562423Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:26b82a76942998f9b2ad065086636f25abf80be5219e8bdf758e10affcc79064","observation_id":"10e2b154-614f-429e-bd7e-aceb10d84581","resolution":{"observed_at":"2026-08-07T13:08:07.562423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10763","last_updated":"2024-04-16T17:47:16Z","snapshot_observed_at":"2026-08-03T03:48:22.435130Z","submitted_at":"2024-04-16T17:47:16Z","title":"LaDiC: Are Diffusion Models Really Inferior to Autoregressive Counterparts for Image-to-Text Generation?","version":1},"cited_work":{"arxiv_id":"2404.10763","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.10763","snapshot_observed_at":"2026-08-07T13:08:09.352204Z","title":"LaDiC: Are Diffusion Models Really Inferior to Autoregressive Counterparts for Image-to-Text Generation?","venue":"cs.AI","work_id":"885e384f-0a9f-49a1-9b79-66f1d620ddae","year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:07.687577Z"},"links":{"cited_paper":"/paper/2404.10763","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:3edc36f998d33a932c50e06821bd07922c9e3f3b496443364300effcd7140aad","observation_id":"0946a2de-47c2-4566-92ca-7f82c54c7637","resolution":{"observed_at":"2026-08-07T13:08:09.404505Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-07T13:08:07.783271Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:07.783271Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:fa41bb444bb6f6831a8934d9ef732281e74959a7b83040ed2cffd6d569363068","observation_id":"c8d4c1e2-bb6e-428d-984e-240281321dc1","resolution":{"observed_at":"2026-08-07T13:08:07.783271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17251","last_updated":"2024-12-28T17:46:27Z","snapshot_observed_at":"2026-08-04T04:41:42.466716Z","submitted_at":"2024-10-22T17:59:57Z","title":"Altogether: Image Captioning via Re-aligning Alt-text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17251","snapshot_observed_at":"2026-08-07T13:08:07.915717Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:07.915717Z"},"links":{"cited_paper":"/paper/2410.17251","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:e73ad3e4770713b46b3db594bc5926d72bdb81afc55ef57e6feb6242e2779895","observation_id":"b48f0b6e-904e-436b-ace1-e253840de87c","resolution":{"observed_at":"2026-08-07T13:08:07.915717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:08.086271Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:08.086271Z"},"links":{"citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:b578784ff0620a132b4cae77dabbefd2bbd0afe24d561264780b9872e63d70b0","observation_id":"4a1361b2-4b68-4d2e-adf4-9a1239c4f5a1","resolution":{"observed_at":"2026-08-07T13:08:08.086271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09371","last_updated":"2023-03-19T12:31:20Z","snapshot_observed_at":"2026-08-03T19:01:08.627867Z","submitted_at":"2022-11-17T06:55:49Z","title":"CapEnrich: Enriching Caption Semantics for Web Images via Cross-modal Pre-trained Knowledge","version":3},"cited_work":{"arxiv_id":"2211.09371","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.09371","snapshot_observed_at":"2026-08-07T13:08:09.018030Z","title":"CapEnrich: Enriching Caption Semantics for Web Images via Cross-modal Pre-trained Knowledge","venue":"cs.CV","work_id":"db01868d-dbd3-4a76-948d-3c23e5f52d42","year":2022},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:08.229404Z"},"links":{"cited_paper":"/paper/2211.09371","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:bad8d6a936ffb6a91b19430e0d987a5ab146af10f668de7a84d2d45812d1c2b9","observation_id":"e07b8e6d-61fa-4e78-9970-982a6a4e66c1","resolution":{"observed_at":"2026-08-07T13:08:09.129159Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07906","last_updated":"2025-03-10T22:53:56Z","snapshot_observed_at":"2026-08-07T17:14:48.411395Z","submitted_at":"2025-03-10T22:53:56Z","title":"Painting with Words: Elevating Detailed Image Captioning with Benchmark and Alignment Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07906","snapshot_observed_at":"2026-08-07T13:08:08.373390Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:08.373390Z"},"links":{"cited_paper":"/paper/2503.07906","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:066948667b2c1de64415928d0a0461be4b1e3c30c8b8a79ed5f63766fc4f65e0","observation_id":"264c1c5c-0e8a-4328-a5a9-f06044edce12","resolution":{"observed_at":"2026-08-07T13:08:08.373390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20550","last_updated":"2024-04-05T05:29:29Z","snapshot_observed_at":"2026-07-06T16:41:11.586802Z","submitted_at":"2023-10-31T15:31:39Z","title":"CapsFusion: Rethinking Image-Text Data at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20550","snapshot_observed_at":"2026-08-07T13:08:08.450760Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:08.450760Z"},"links":{"cited_paper":"/paper/2310.20550","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:f4053b5d8765c3514ceda6875bbbbbb56bf60ac87bbfbe33cbe9198d33f7608d","observation_id":"282cb1db-1d9d-4e8f-86a7-92e62621b0dd","resolution":{"observed_at":"2026-08-07T13:08:08.450760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-07T13:08:08.594375Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:08.594375Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:ea8c2a2b3ec4b74f7f0589aaadae4769932c981ef2096c2fa85979f378106b24","observation_id":"b41ccc6b-4fa4-493f-9796-3b6bb1bd2b2f","resolution":{"observed_at":"2026-08-07T13:08:08.594375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T13:08:08.677298Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:08.677298Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:689ba155fafac23c3a9a38bc812ef94102486117bbd7561d1fc1a3ab3a8b9c92","observation_id":"a5967b2d-3470-487a-9840-053c41c5eff8","resolution":{"observed_at":"2026-08-07T13:08:08.677298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:08.782189Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:08.782189Z"},"links":{"citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:5a1eaebea05243c93d058527a5e8c30fd6fe37f8ec2787bf498b86f59c09f75c","observation_id":"38de8f72-b661-4f69-92fa-c19e8eda71ef","resolution":{"observed_at":"2026-08-07T13:08:08.782189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:08:08.869281Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:08.869281Z"},"links":{"citing_paper":"/paper/2505.22613"},"observation_digest":"sha256:45a192fa8dd2e3e943b90592daabb7e49d18aa3f362f453f2e1b11c3b6b9f797","observation_id":"b10c9615-855e-404a-ac3e-97799e4bf9d0","resolution":{"observed_at":"2026-08-07T13:08:08.869281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22613","last_updated":"2025-05-28T17:29:34Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T13:00:45.454980Z","submitted_at":"2025-05-28T17:29:34Z","title":"RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":56,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2505.22613."}