{"as_of":"2026-08-17T05:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6deee91fcfa087bf2dfa79fa30f5640c555ac32acf40cc97a136f78eb0efa7d5","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:54:07.515977Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.20077/citation-record","integrity":"/paper/2507.20077/integrity","json":"/paper/2507.20077/citation-record.json","paper":"/paper/2507.20077"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-15T17:54:07.322798Z","title":"Paligemma: A Versatile 3b VLM for Transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.322798Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:399c1f3f5cff6804b1f6e39312e3aef7a3da8fd57de4d2345e2b901473ba1581","observation_id":"0624d9cb-9611-49e4-a0c4-6ab2837250a3","resolution":{"observed_at":"2026-08-15T17:54:07.322798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-14T06:42:43.375489Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-15T17:54:07.328336Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.328336Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:ba59dead385978f16d204112a1719b7293b659681943e4b00a6a10c9b1358196","observation_id":"f358341f-b779-4f69-a7b9-07b20b28f586","resolution":{"observed_at":"2026-08-15T17:54:07.328336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.13115","last_updated":"2023-03-29T18:26:34Z","snapshot_observed_at":"2026-08-16T16:57:35.075265Z","submitted_at":"2022-05-26T02:46:09Z","title":"Fine-grained Image Captioning with CLIP Reward","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.13115","snapshot_observed_at":"2026-08-15T17:54:07.333485Z","title":"Fine-grained Image Captioning with CLIP Reward","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.333485Z"},"links":{"cited_paper":"/paper/2205.13115","citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:97101f94654529cca10bee6764e9f64d569c188e4a5a8b086f92ae84eeb4af91","observation_id":"ce59b7fb-8c53-4bfc-b2f0-6ba1f2fa19ba","resolution":{"observed_at":"2026-08-15T17:54:07.333485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:07.339079Z","title":"The Algebraic Theory of Context-Free Languages","venue":null,"work_id":null,"year":1959},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.339079Z"},"links":{"citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:a52083ba25544e1ef2343a2202a5859d6a0afb74a022f1578b789dd08981b344","observation_id":"d3da41f1-2963-478f-a434-db4a76722e28","resolution":{"observed_at":"2026-08-15T17:54:07.339079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19092","last_updated":"2024-07-07T17:06:59Z","snapshot_observed_at":"2026-08-16T13:48:12.744103Z","submitted_at":"2024-05-29T13:54:12Z","title":"Benchmarking and Improving Detail Image Caption","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19092","snapshot_observed_at":"2026-08-15T17:54:07.344293Z","title":"Benchmarking and Improving Detail Image Caption","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.344293Z"},"links":{"cited_paper":"/paper/2405.19092","citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:909b237b7a9352f51df138472b37638f0f0c04b4d1af625bef7ceb5ef1523d9a","observation_id":"6582daf6-ea7e-44e8-9f6c-13f669ff27d0","resolution":{"observed_at":"2026-08-15T17:54:07.344293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.04264","last_updated":"2020-11-09T09:23:55Z","snapshot_observed_at":"2026-08-16T19:07:15.682879Z","submitted_at":"2020-11-09T09:23:55Z","title":"CapWAP: Captioning with a Purpose","version":1},"cited_work":{"arxiv_id":"2011.04264","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.04264","snapshot_observed_at":"2026-08-15T17:54:08.116929Z","title":"CapWAP: Captioning with a Purpose","venue":"cs.CL","work_id":"a6875fb8-d303-4bcf-b577-3252c256ee58","year":2020},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.349697Z"},"links":{"cited_paper":"/paper/2011.04264","citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:4bc1fc4d8d02531c94889d2f89dcdb71ff2ccb500e17de27a0726c03fb96acc8","observation_id":"2f910008-b06e-42b0-b43b-ef48e466b577","resolution":{"observed_at":"2026-08-15T17:54:08.121936Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03025","last_updated":"2025-04-09T04:34:41Z","snapshot_observed_at":"2026-08-16T13:21:17.870398Z","submitted_at":"2024-09-04T18:32:39Z","title":"No Detail Left Behind: Revisiting Self-Retrieval for Fine-Grained Image Captioning","version":2},"cited_work":{"arxiv_id":"2409.03025","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.03025","snapshot_observed_at":"2026-08-15T17:54:08.094611Z","title":"No Detail Left Behind: Revisiting Self-Retrieval for Fine-Grained Image Captioning","venue":"cs.CV","work_id":"fe018865-5128-463b-a54f-95533f4a8c4e","year":2024},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.356064Z"},"links":{"cited_paper":"/paper/2409.03025","citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:6e9f70ff0687d6c426d9ce15b3c4210dd08e932410b6deeb54804044665729b0","observation_id":"b2005623-1644-43a5-aa77-1e458d9424b2","resolution":{"observed_at":"2026-08-15T17:54:08.099843Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:07.361098Z","title":"From Descriptive Richness to Bias: Unveiling the Dark Side of Generative Image Caption Enrichment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.361098Z"},"links":{"citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:86d0e06efaed2b714d592e7b401fa73bbe90046e644909a23807fd44b640ee46","observation_id":"b01f437d-ef05-459b-836a-5b633010f21e","resolution":{"observed_at":"2026-08-15T17:54:07.361098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09751","last_updated":"2020-02-14T21:56:30Z","snapshot_observed_at":"2026-07-06T07:47:32.745963Z","submitted_at":"2019-04-22T07:17:18Z","title":"The Curious Case of Neural Text Degeneration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09751","snapshot_observed_at":"2026-08-15T17:54:07.365635Z","title":"The Curious Case of Neural Text Degeneration","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.365635Z"},"links":{"cited_paper":"/paper/1904.09751","citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:fbafeba6a932ae89451c2545ec9c01f6c753c4308a83c4dbe8938c12d92af1c6","observation_id":"dde5ebe1-0b55-4482-a6f5-c4a4bb08bae0","resolution":{"observed_at":"2026-08-15T17:54:07.365635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08914","last_updated":"2021-12-22T16:19:33Z","snapshot_observed_at":"2026-08-16T17:34:03.794270Z","submitted_at":"2021-12-16T14:33:12Z","title":"Characterizing and addressing the issue of oversmoothing in neural autoregressive sequence modeling","version":2},"cited_work":{"arxiv_id":"2112.08914","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.08914","snapshot_observed_at":"2026-08-15T17:54:08.056326Z","title":"Characterizing and addressing the issue of oversmoothing in neural autoregressive sequence modeling","venue":"cs.LG","work_id":"8fd41ed1-92b7-42a1-b235-1943d920480a","year":2021},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.370541Z"},"links":{"cited_paper":"/paper/2112.08914","citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:e2d91c00f2608471668cdcdaf666baae2ceabbc9a550b2619037c52bbf1e6a63","observation_id":"7a85df6d-5bd8-47dc-b4a1-87549b3cf755","resolution":{"observed_at":"2026-08-15T17:54:08.062032Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-15T17:54:07.375622Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.375622Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:727a9ea60e6b910a5a93276d5aa5a7366a4c3e4028f2df9e8d4859e5d8cf3538","observation_id":"a2ec6674-1c81-4224-8c2e-86bab710e7e4","resolution":{"observed_at":"2026-08-15T17:54:07.375622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:08.336939Z","title":"Microsoft COCO: Common Objects in Context","venue":null,"work_id":"f0641cf1-7560-45ff-bfb2-23f4a659bda5","year":2014},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.380550Z"},"links":{"citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:983a597294772a830915ccd5a5c0d01308bf927bece86be89f7cf097c5ade38e","observation_id":"3122664a-de87-4942-acba-29a20441971b","resolution":{"observed_at":"2026-08-15T17:54:08.341967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-15T17:54:07.384973Z","title":"Visual Instruction Tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.384973Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:74df8e873b4b970ffb08cd81a622f64e2239ed97ae0bc2173139a3076a254750","observation_id":"0ffa2db8-6a74-444f-9842-c0c86a806556","resolution":{"observed_at":"2026-08-15T17:54:07.384973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:08.320392Z","title":"Discriminability Objective for Training Descriptive Captions","venue":null,"work_id":"3989ef59-3ae1-4e4f-b838-9fb825d9da5a","year":2018},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.389948Z"},"links":{"citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:0e0d3d7a55e6c9738e4c6f6e581c92e7f82949241fe91989de39deecf8da5578","observation_id":"103392dd-e5f8-4691-b8fc-a3279d61d8aa","resolution":{"observed_at":"2026-08-15T17:54:08.325668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07174","last_updated":"2020-10-14T15:46:17Z","snapshot_observed_at":"2026-08-16T19:13:31.936558Z","submitted_at":"2020-10-14T15:46:17Z","title":"The EOS Decision and Length Extrapolation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.07174","snapshot_observed_at":"2026-08-15T17:54:07.394493Z","title":"The EOS Decision and Length Extrapolation","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.394493Z"},"links":{"cited_paper":"/paper/2010.07174","citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:dbace1294546286481ce476514b7db48ff0c3346b8807919ec535b9832323351","observation_id":"acb5cc9e-175f-461c-a20d-4bdab1a92b19","resolution":{"observed_at":"2026-08-15T17:54:07.394493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-73027-6_17","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:07.559404Z","title":"DOCCI: Descriptions of Connected and Contrasting Images","venue":null,"work_id":"0f31394e-47df-4f61-a856-5951a66e247f","year":2024},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.399479Z"},"links":{"citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:7830ec1cdef75ea8eb77bf8db85e725c08d077b5058caba2dfafa6da4e6a6698","observation_id":"da94358b-cf95-47e1-bf17-41bb902efa3f","resolution":{"observed_at":"2026-08-15T17:54:07.565999Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:08.303928Z","title":"GPT-4V Technical Report , 2023","venue":null,"work_id":"c879703a-0849-4eaa-9582-eae7ecefdae0","year":2023},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.404396Z"},"links":{"citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:d7b0646c6b13acf59e18be6624ef643e19d9abc484afc4dde883ea8a92a525d6","observation_id":"9663f285-fd72-497a-a68d-781ff26ede28","resolution":{"observed_at":"2026-08-15T17:54:08.309142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02904","last_updated":"2024-04-03T17:59:36Z","snapshot_observed_at":"2026-08-16T14:03:52.361202Z","submitted_at":"2024-04-03T17:59:36Z","title":"ALOHa: A New Measure for Hallucination in Captioning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02904","snapshot_observed_at":"2026-08-15T17:54:07.409165Z","title":"ALOHa: A New Measure for Hallucination in Captioning Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.409165Z"},"links":{"cited_paper":"/paper/2404.02904","citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:f0b2c0a28f276e29236c3131c767b7a4fb3c811b84371f29703a5a18ffb7575a","observation_id":"0aed9076-92a6-418d-9836-e065dfd2bc7d","resolution":{"observed_at":"2026-08-15T17:54:07.409165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07502","last_updated":"2024-06-11T17:37:45Z","snapshot_observed_at":"2026-08-16T13:44:04.481701Z","submitted_at":"2024-06-11T17:37:45Z","title":"Image Textualization: An Automatic Framework for Creating Accurate and Detailed Image Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07502","snapshot_observed_at":"2026-08-15T17:54:07.413999Z","title":"Image Textualization: An Automatic Framework for Creating Accurate and Detailed Image Descriptions , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.413999Z"},"links":{"cited_paper":"/paper/2406.07502","citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:3295a4c3092c3003c05cefc7684a4f97dddb1501561b417ed611df64c218dbe0","observation_id":"3adcb4a1-18f9-40fc-8f84-5cce86468310","resolution":{"observed_at":"2026-08-15T17:54:07.413999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06732","last_updated":"2016-05-06T21:18:46Z","snapshot_observed_at":"2026-08-14T22:21:58.983002Z","submitted_at":"2015-11-20T19:25:54Z","title":"Sequence Level Training with Recurrent Neural Networks","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06732","snapshot_observed_at":"2026-08-15T17:54:07.419117Z","title":"Sequence Level Training with Recurrent Neural Networks , 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.419117Z"},"links":{"cited_paper":"/paper/1511.06732","citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:5e373ed28b12007ffc2f7ded15a20f4bfcb7f03087cebcdf4e277b7c1eb5dfb7","observation_id":"513da7fb-1789-476f-949e-29ae254f1f06","resolution":{"observed_at":"2026-08-15T17:54:07.419117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:08.287158Z","title":"Rennie, Etienne Marcheret, Youssef Mroueh, Jerret Ross, and Vaibhava Goel","venue":null,"work_id":"76a2444a-b500-4f76-94e7-4c2d4bd1a19b","year":2017},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.423936Z"},"links":{"citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:d46e3508d2a8e45045ad14ed1a7739e0c91cf760794953f1bc0088793ab8b205","observation_id":"89b08276-ca49-45ee-9679-ea7b4a613893","resolution":{"observed_at":"2026-08-15T17:54:08.292646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02156","last_updated":"2019-03-29T23:48:52Z","snapshot_observed_at":"2026-08-16T11:34:00.114590Z","submitted_at":"2018-09-06T18:25:18Z","title":"Object Hallucination in Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02156","snapshot_observed_at":"2026-08-15T17:54:07.428543Z","title":"Object Hallucination in Image Captioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.428543Z"},"links":{"cited_paper":"/paper/1809.02156","citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:74fc282514cabb3c0abc200b99610490d7b465a183bbe7455756dc570ab369db","observation_id":"2515554f-2d20-4695-8696-935fc4fe77fb","resolution":{"observed_at":"2026-08-15T17:54:07.428543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05967","last_updated":"2024-11-04T07:55:31Z","snapshot_observed_at":"2026-08-16T13:44:42.394406Z","submitted_at":"2024-06-10T01:59:00Z","title":"CVQA: Culturally-diverse Multilingual Visual Question Answering Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05967","snapshot_observed_at":"2026-08-15T17:54:07.433172Z","title":"CVQA: Culturally-Diverse Multilingual Visual Question Answering Benchmark , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.433172Z"},"links":{"cited_paper":"/paper/2406.05967","citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:51ead64963c7890de4f9d205cd7c6ba30eee7804de38182ad75bcc371e964313","observation_id":"29b33775-fc13-45a1-b809-616da9dad5de","resolution":{"observed_at":"2026-08-15T17:54:07.433172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-08-16T13:42:51.448762Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-08-15T17:54:07.438008Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.438008Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:c00cdf5ebe124a5556b2b35f4c863a9d9d824ee51824d9315e8f8c7659a2f1f8","observation_id":"85f1e6ad-7c88-4317-bf25-ac39b0323c24","resolution":{"observed_at":"2026-08-15T17:54:07.438008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14140","last_updated":"2023-02-14T14:22:42Z","snapshot_observed_at":"2026-08-16T16:21:14.484602Z","submitted_at":"2022-10-25T16:40:48Z","title":"Contrastive Search Is What You Need For Neural Text Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.14140","snapshot_observed_at":"2026-08-15T17:54:07.442672Z","title":"Contrastive Search is What You Need for Neural Text Generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.442672Z"},"links":{"cited_paper":"/paper/2210.14140","citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:dbacdbca0f09d85957f4549584a9767c10f18556cc352c2ebbfd5bf8f5296933","observation_id":"396b9d9c-d248-4e5e-9170-a755796b90c2","resolution":{"observed_at":"2026-08-15T17:54:07.442672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:08.271096Z","title":"A Picture is Worth More than 77 Text Tokens: Evaluating CLIP-Style Models on Dense Captions","venue":null,"work_id":"4fa1e1ef-da95-4119-ac25-e8ac2cb5f635","year":2024},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.447409Z"},"links":{"citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:a0bb78b07c3af651cb9fd1ac3d07e48fde2525068f4920dae7168df9aec2893d","observation_id":"0c495e41-7127-4fbe-8353-39c7f1492d5f","resolution":{"observed_at":"2026-08-15T17:54:08.276416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1411.5726","last_updated":"2015-06-03T01:42:20Z","snapshot_observed_at":"2026-08-14T23:10:48.763001Z","submitted_at":"2014-11-20T23:54:35Z","title":"CIDEr: Consensus-based Image Description Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.5726","snapshot_observed_at":"2026-08-15T17:54:07.451834Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.451834Z"},"links":{"cited_paper":"/paper/1411.5726","citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:15bb12fee665fa4a4e65920a03758bc6560623c2121f21f62c2165a952908f5a","observation_id":"b3a24ac9-6b6e-48aa-a166-c96c4f413fd8","resolution":{"observed_at":"2026-08-15T17:54:07.451834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:08.254980Z","title":"Show and Tell: A Neural Image Caption Generator","venue":null,"work_id":"7a866aa0-84be-4616-a623-5341f06005ad","year":2015},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.456731Z"},"links":{"citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:78f1530b0a901e9c8e5c4eab64cf4743a15fd64f5bd258974ddb0dae1fb3cfd7","observation_id":"bd32f109-310d-4f9f-abe3-7f1cc89215c6","resolution":{"observed_at":"2026-08-15T17:54:08.259804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:07.460908Z","title":"Williams and David Zipser","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.460908Z"},"links":{"citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:af986571e495c2af2bde8f593a2e69175b8e5f0e98ebe8327391d6efbb65b6f1","observation_id":"a527a13f-90bd-44f5-bb4c-51066d687006","resolution":{"observed_at":"2026-08-15T17:54:07.460908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-15T17:54:07.465513Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.465513Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:3baf98616898f720d400d59f05c865bde96367a933f5cbaed6896b202d329b13","observation_id":"ff799bb0-a499-45b0-92ac-706ca3e80c74","resolution":{"observed_at":"2026-08-15T17:54:07.465513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13460","last_updated":"2023-10-28T11:44:48Z","snapshot_observed_at":"2026-08-16T15:21:41.067615Z","submitted_at":"2023-06-23T12:03:07Z","title":"Learning Descriptive Image Captioning via Semipermeable Maximum Likelihood Estimation","version":3},"cited_work":{"arxiv_id":"2306.13460","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.13460","snapshot_observed_at":"2026-08-15T17:54:07.837537Z","title":"Learning Descriptive Image Captioning via Semipermeable Maximum Likelihood Estimation","venue":"cs.CL","work_id":"495a5fe5-c160-41ea-a8f9-72cf708d4200","year":2023},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.470207Z"},"links":{"cited_paper":"/paper/2306.13460","citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:579062103af74fc7160c13cd6117db33a08132a891cfcefa122cc306dd69da3b","observation_id":"c3bfa728-1bcd-478f-9d6e-2811cfbb57c9","resolution":{"observed_at":"2026-08-15T17:54:07.843322Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14545","last_updated":"2024-05-29T05:55:09Z","snapshot_observed_at":"2026-08-16T14:16:15.314341Z","submitted_at":"2024-02-22T13:33:13Z","title":"Less is More: Mitigating Multimodal Hallucination from an EOS Decision Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14545","snapshot_observed_at":"2026-08-15T17:54:07.475975Z","title":"Less is More: Mitigating Multimodal Hallucination from an EOS Decision Perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.475975Z"},"links":{"cited_paper":"/paper/2402.14545","citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:acc2abd2cc6ce699365b59dccf8804bbf2b89f6faf8e33c8f0f75bd3bbbc2d77","observation_id":"d65f81b4-967e-404e-8654-878df42752e8","resolution":{"observed_at":"2026-08-15T17:54:07.475975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:08.239633Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","venue":null,"work_id":"b638c560-dbab-4859-9646-1a4aeb0f81df","year":2024},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.480877Z"},"links":{"citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:3503033cd4ada2b5fc1a7eb094265c6cdc3733dd4f409c5e2fa5d57b4781c29c","observation_id":"a3cd6475-4543-4c0e-8236-abd437ac145b","resolution":{"observed_at":"2026-08-15T17:54:08.244519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:08.223691Z","title":"Judging LLM-as-a-Judge with MT-Bench and ChatBot Arena","venue":null,"work_id":"d3ec3106-167c-482f-b867-894eab1fb01f","year":2023},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.485349Z"},"links":{"citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:82b48e2718a1764a202bd8b69358d5e23632cc3932187d2eb8da9e2d36559083","observation_id":"f718f707-c561-4728-8380-7e35690e5b44","resolution":{"observed_at":"2026-08-15T17:54:08.229072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14289","last_updated":"2024-02-22T05:05:30Z","snapshot_observed_at":"2026-08-16T20:05:44.296509Z","submitted_at":"2024-02-22T05:05:30Z","title":"TinyLLaVA: A Framework of Small-scale Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14289","snapshot_observed_at":"2026-08-15T17:54:07.489842Z","title":"Tinyllava: A Framework of Small-Scale Large Multimodal Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.489842Z"},"links":{"cited_paper":"/paper/2402.14289","citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:d9635f6f5fe1daab197b7626330f6271a8d928319f071190fb32b6d79e32cb02","observation_id":"6f086885-8685-4fc2-b806-57d9071481e0","resolution":{"observed_at":"2026-08-15T17:54:07.489842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00754","last_updated":"2024-03-16T19:28:08Z","snapshot_observed_at":"2026-08-13T00:44:34.883184Z","submitted_at":"2023-10-01T18:10:53Z","title":"Analyzing and Mitigating Object Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00754","snapshot_observed_at":"2026-08-15T17:54:07.495920Z","title":"Analyzing and Mitigating Object Hallucination in Large Vision-Language Models , 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.495920Z"},"links":{"cited_paper":"/paper/2310.00754","citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:4fd99ad512fdf3f63ff072b4d1134956fdb190246bd4b1ec3baf6342e722c700","observation_id":"f7e04bb7-6ef2-4bcc-940e-cb9fbbfdbcac","resolution":{"observed_at":"2026-08-15T17:54:07.495920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:07.500846Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.500846Z"},"links":{"citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:14a36827b8cbff3ac7e057157395cad687246d22e18af6d85a2e77274a5ff74b","observation_id":"f09177a3-2dff-408d-b6d8-41e2b961faf9","resolution":{"observed_at":"2026-08-15T17:54:07.500846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:07.506424Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.506424Z"},"links":{"citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:fa84e62d546e40bde8fd0e8eb08e70d0e281176c6b479d3bcc953d9489f8d0ec","observation_id":"5ad4be19-2a90-4da5-aed7-b1bedd829d8c","resolution":{"observed_at":"2026-08-15T17:54:07.506424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:07.511197Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.511197Z"},"links":{"citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:8e105127f773dbc6663f454051147985d8a6a12ec4524b1a2c4845d216e84609","observation_id":"e9de5f4f-b01c-4a4e-831e-660f9102906f","resolution":{"observed_at":"2026-08-15T17:54:07.511197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:07.515977Z","title":"\\\\ DCI & 7,805 & 10 & 45 & Images from SA-1B with detailed captions of up to 77 tokens, summarized with an LLM from hyper-detailed captions of 1k tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:07.515977Z"},"links":{"citing_paper":"/paper/2507.20077"},"observation_digest":"sha256:17352f9e20fd1d1273c874089f1edaf02aca748895d0efd89d3797bf4fbb43c0","observation_id":"3211a005-83a0-478e-b09a-3f91a3c860a5","resolution":{"observed_at":"2026-08-15T17:54:07.515977Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.20077","last_updated":"2025-08-21T12:46:42Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T17:47:50.686030Z","submitted_at":"2025-07-26T23:00:43Z","title":"The Devil is in the EOS: Sequence Training for Detailed Image Captioning"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":5,"verified_fuzzy":8},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2507.20077."}