{"as_of":"2026-08-09T11:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:289dfeae8c6c951025a1febcf9088b9c7dd6aee3f12ca1a97d769bb876ac29fc","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T15:58:45.433734Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.28986/citation-record","integrity":"/paper/2607.28986/integrity","json":"/paper/2607.28986/citation-record.json","paper":"/paper/2607.28986"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-03T15:58:39.520616Z","title":"Clipcap: Clip prefix for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:39.520616Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:4bac5c2ffa77aa3d9d5185ca9d503124406ce936687006933a8fe100c0e8e731","observation_id":"5627ffab-96fe-4073-beb5-8f53e77b3fa6","resolution":{"observed_at":"2026-08-03T15:58:39.520616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:39.609597Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:39.609597Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:6679f192a6a1d6df4444a25285a0ebfb98c0b67fa60fe815e8e047001922629c","observation_id":"ad83ab27-26fa-4c61-882f-aa8798243383","resolution":{"observed_at":"2026-08-03T15:58:39.609597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:39.734298Z","title":"Text-only training for image captioning using noise-injected clip,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:39.734298Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:8ea4ae93ab6f7abed2911afb349f9457a5d687e86e739c44acac22941dfa4b0d","observation_id":"2a44bd12-5c07-4c6c-9f4d-8e942c283bf0","resolution":{"observed_at":"2026-08-03T15:58:39.734298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:39.823113Z","title":"Decap: Decoding CLIP latents for zero-shot captioning via text-only training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:39.823113Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:e765547c6e4947995e2c76faa3c442912507baf7c3b19b702f88c66294c2aab5","observation_id":"44771dda-60f6-4b79-9cec-298d405be4c9","resolution":{"observed_at":"2026-08-03T15:58:39.823113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:39.980670Z","title":"Transferable decoding with visual entities for zero-shot image captioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:39.980670Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:cc95400b4cb2898f8bcdf13de42d618c7ab885c9bcd1c355c5c72abf0a3fec9e","observation_id":"7947e6e4-f7a6-46ab-b6e3-07829f9101a0","resolution":{"observed_at":"2026-08-03T15:58:39.980670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:40.126610Z","title":"Meacap: Memory-augmented zero-shot image captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:40.126610Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:661413a7249ebbc780dc85e484d5d8642ecdefb26328b829e21888052fb5fe02","observation_id":"189ffc23-07d8-4096-a10a-0ac49229bb89","resolution":{"observed_at":"2026-08-03T15:58:40.126610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:40.152829Z","title":"Ifcap: Image-like retrieval and frequency-based entity filtering for zero-shot captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:40.152829Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:5f08b4dab8e6c941791852d2652d35ac689a54c7905ee578a579b815e4cf8e99","observation_id":"c4439427-2362-492f-9b2e-b64535c76846","resolution":{"observed_at":"2026-08-03T15:58:40.152829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:40.219703Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:40.219703Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:e2527751c17e96f90c94bf260b101e25e77606e39171576a8f8f89de47696f1f","observation_id":"960a2440-c363-4372-881b-7efd265ca737","resolution":{"observed_at":"2026-08-03T15:58:40.219703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:40.281376Z","title":"Deep visual-semantic alignments for generating image descriptions,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:40.281376Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:f325537e5c823734ca2c5af8718332e3251b85cf134895699fedd4c3144a751d","observation_id":"90f35b11-1843-46a1-b5fc-c30f802cfbb0","resolution":{"observed_at":"2026-08-03T15:58:40.281376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:40.421756Z","title":"Negative entity suppression for zero-shot captioning with synthetic images,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:40.421756Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:08e165c58738e6764a0ebc882fc2de4cc684888615d03274f6c732686c863b16","observation_id":"d9101838-d9e1-4c49-a2f6-86f3ec13867e","resolution":{"observed_at":"2026-08-03T15:58:40.421756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:40.565396Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:40.565396Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:0698d529af33c70081a3f9f68599eb06401301059aa06583742de577b13f6851","observation_id":"7787dae4-e9fb-468f-a8e1-f44b59d7c100","resolution":{"observed_at":"2026-08-03T15:58:40.565396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:40.730143Z","title":"Reproducible scaling laws for contrastive language-image learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:40.730143Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:a26fa0f9287cfc110836153cea4737b206be0730e05ef9ea651521f77a34d5e7","observation_id":"a10b080f-8cfc-464f-9126-4f186749e37e","resolution":{"observed_at":"2026-08-03T15:58:40.730143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:40.933094Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:40.933094Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:30ce4f3d16e008be57431f9c491033d6b298e58afa80fb1cb6aafccb6f8d7fe1","observation_id":"42b4f70f-73ff-438d-a627-04d9237b8074","resolution":{"observed_at":"2026-08-03T15:58:40.933094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:41.056038Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptions,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:41.056038Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:3751a98954aac6457311684040a5e591df5f9abc9a245cb3c4dc1b646caac7f0","observation_id":"78b0dcf4-d224-4307-a847-f967b8a28474","resolution":{"observed_at":"2026-08-03T15:58:41.056038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:41.180157Z","title":"Flickr30k entities: Collecting region-to-phrase corre- spondences for richer image-to-sentence models,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:41.180157Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:7107a11b284978058a2a4c32a8728c88fb1cf8f2fb3ecccec93ff5017c4f5e33","observation_id":"7ccc8551-04de-4120-9a8b-7ef6dd8a5806","resolution":{"observed_at":"2026-08-03T15:58:41.180157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:41.299080Z","title":"Nocaps: Novel object captioning at scale,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:41.299080Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:3851f4dc92f80c1ca924d5f2379e3013d1aa128b6a15632e4617361340bc75e4","observation_id":"e82a290b-1d8f-436c-913f-bea19500fb11","resolution":{"observed_at":"2026-08-03T15:58:41.299080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:41.479045Z","title":"Sampling-based approximations to minimum bayes risk decoding for neural machine translation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:41.479045Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:37ec2b46790e0f124b72714f79a2b61deef83f66dd1f3c01dff96230b13acd88","observation_id":"dc53cf64-c11e-4a7f-b68c-386203b3f4b7","resolution":{"observed_at":"2026-08-03T15:58:41.479045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:41.668748Z","title":"Learning to rank: from pairwise approach to listwise approach,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:41.668748Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:30b0ce4a0b9e87481f186b0aef88db67c617cc958cc8574b328023451285ab6a","observation_id":"a56668e8-4078-4a2c-b87a-78f95cacb825","resolution":{"observed_at":"2026-08-03T15:58:41.668748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:41.854210Z","title":"Zerocap: Zero-shot image-to-text generation for visual-semantic arithmetic,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:41.854210Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:48e5237766cb81aa4c81145f778590f3d3294c0f6462d2bbaaef5cc6242c0c30","observation_id":"b39701a0-4f1c-4f89-932d-72729e4af4cd","resolution":{"observed_at":"2026-08-03T15:58:41.854210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.02655","last_updated":"2022-05-30T19:45:05Z","snapshot_observed_at":"2026-08-06T04:48:55.317633Z","submitted_at":"2022-05-05T13:56:18Z","title":"Language Models Can See: Plugging Visual Controls in Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.02655","snapshot_observed_at":"2026-08-03T15:58:41.918019Z","title":"Language models can see: Plugging visual controls in text generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:41.918019Z"},"links":{"cited_paper":"/paper/2205.02655","citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:0c01790bcdaa240257b40b8a656c776b546cb8541866e042514cf547e4be9832","observation_id":"29dba067-8766-412f-99e3-33e03a8f1616","resolution":{"observed_at":"2026-08-03T15:58:41.918019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:42.073882Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:42.073882Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:99a0a54b268cb36fcdee4135c4cc9957fcac421590928dd81adbeee91a2a3d60","observation_id":"9c47659c-c5bc-48f4-84b0-3ab7babc2822","resolution":{"observed_at":"2026-08-03T15:58:42.073882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:42.188011Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:42.188011Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:1359f7515cbb6cbabb08aaf418c8d39c734551025fbb16fbaaa45a2d6d63ebb1","observation_id":"0ccb45c9-ee5b-4cb2-9932-f1eb344c63bb","resolution":{"observed_at":"2026-08-03T15:58:42.188011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:42.268225Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:42.268225Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:ec357a696bbf944deaaec62fc3f04b04f2b43e7611a29c31ddb15dfbef35ab6f","observation_id":"bbb4196e-ae0a-4d29-8d4f-db03d786f8ad","resolution":{"observed_at":"2026-08-03T15:58:42.268225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:42.376683Z","title":"Improving cross-modal alignment with synthetic pairs for text-only image captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:42.376683Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:dba3ea4120ce05b31481503fdca19ef7599ecd08ab8a4f4e02cf76258cdee975","observation_id":"85bcb24d-a3b3-4017-a7af-b02c3d39b087","resolution":{"observed_at":"2026-08-03T15:58:42.376683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:42.491354Z","title":"High- resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:42.491354Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:b668eedd7f5e990da612e2659cb62797152be0e952f5fe811db887363cd0751f","observation_id":"76203868-2826-4647-86c1-d6993d6d985b","resolution":{"observed_at":"2026-08-03T15:58:42.491354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:42.619479Z","title":"Unleashing text-to-image diffusion prior for zero-shot image captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:42.619479Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:450e5741e60eedafe6e760b57b9d15001e77177ac8dd33759ce0e4271a66ccc7","observation_id":"a11d0cb2-cad7-4a6c-bf18-e13a68fc1f4c","resolution":{"observed_at":"2026-08-03T15:58:42.619479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:42.717152Z","title":"Clipscore: A reference-free evaluation metric for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:42.717152Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:91a744ae96f141729af68ab3535f13d822ed6e9a46703bc93720f92b858b4ca1","observation_id":"d75a1179-0c63-4260-99f7-88ba09cb3a75","resolution":{"observed_at":"2026-08-03T15:58:42.717152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.04085","last_updated":"2020-04-14T14:57:40Z","snapshot_observed_at":"2026-08-02T11:18:37.014004Z","submitted_at":"2019-01-13T23:27:58Z","title":"Passage Re-ranking with BERT","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.04085","snapshot_observed_at":"2026-08-03T15:58:42.820254Z","title":"Passage re-ranking with bert,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:42.820254Z"},"links":{"cited_paper":"/paper/1901.04085","citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:6837ea2e34bc6a2ec49ad46b588bc15cfb9e08f7e08e4d93160b32444c62426a","observation_id":"34bcc67f-ce22-4e2c-b151-357518c2aebb","resolution":{"observed_at":"2026-08-03T15:58:42.820254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-03T15:58:42.971422Z","title":"Distilling the knowledge in a neural network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:42.971422Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:70ecd30294bf4377ca81885faae64a53cf13b6a1e25a56d4ee173697dbef1390","observation_id":"f986fbc8-60c5-4efd-82b9-ecc821a067c7","resolution":{"observed_at":"2026-08-03T15:58:42.971422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:43.126535Z","title":"Prefix-tuning: Optimizing continuous prompts for generation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:43.126535Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:0f05234a60062d3675dc782e8d8f290e170f238cb2a14c62f7cf1e6ca5331808","observation_id":"a192281a-7491-4369-aaf3-1bd4a853b5b0","resolution":{"observed_at":"2026-08-03T15:58:43.126535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:43.237574Z","title":"Laion- 5b: An open large-scale dataset for training next generation image-text models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:43.237574Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:cff951bf548e73e32df30a920747bb1fc1b42415c5e8fa014cc5f2b0507ba14b","observation_id":"2107e262-4378-4636-838c-29db20cc09a3","resolution":{"observed_at":"2026-08-03T15:58:43.237574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-03T15:58:43.343829Z","title":"Gaussian error linear units (gelus),","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:43.343829Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:aa2667a6a9e57ef48566bb5a81e7339d93b83dba5f90343aa87e99ecc47a4c87","observation_id":"8264e5f4-3c0b-4191-820b-6c1af899661d","resolution":{"observed_at":"2026-08-03T15:58:43.343829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:43.466361Z","title":"Rank aggregation methods for the web,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:43.466361Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:e359ddd551bf5b1d0bf2a6ab600e7b630d80ef4001129b654ffdd568819521a3","observation_id":"895f5754-5a62-49e6-9285-e3676fe3111b","resolution":{"observed_at":"2026-08-03T15:58:43.466361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-03T15:58:43.605104Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:43.605104Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:647a22efa3e2bdd267339e1fca41fc76b9b7997819bd3b2f2e61f667bff43361","observation_id":"f32daf06-42a7-4009-9f28-c0d8646960e0","resolution":{"observed_at":"2026-08-03T15:58:43.605104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:43.757098Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:43.757098Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:e4a267def848d73ead6fc533c21e2d4375d27a7a8045cbac5b7f328295e04927","observation_id":"c11bf561-c68b-4662-89d8-0e1c6dfeee7d","resolution":{"observed_at":"2026-08-03T15:58:43.757098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:43.917365Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:43.917365Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:91645cace52e3b13072ff784fe526bc7e86ca076da5498c5181e551e2975c59f","observation_id":"5df83295-208b-4dde-a573-75c9f4e1f706","resolution":{"observed_at":"2026-08-03T15:58:43.917365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:44.113354Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:44.113354Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:6d0f9072bcefa676dc9e07e1aac56216d793b8e5f177f0904f3bed19a39a4aa0","observation_id":"84c7045d-c89c-449d-885b-adcd5f72b3b3","resolution":{"observed_at":"2026-08-03T15:58:44.113354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:44.266677Z","title":"ROUGE: A package for automatic evaluation of summaries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:44.266677Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:ca79c7544b61408a909cd8bcb4af59f288206f5143cfd402072fe0805ca00879","observation_id":"afa0bb61-3eae-445c-a3a5-b9b22593f74b","resolution":{"observed_at":"2026-08-03T15:58:44.266677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:44.396276Z","title":"Cider: Consensus- based image description evaluation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:44.396276Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:c2257946a4054ee7132ef47e1ddabee65426a8ced9b2c0cf434cec93aaad6d75","observation_id":"a7274775-a681-49c5-b71d-c3052a40d370","resolution":{"observed_at":"2026-08-03T15:58:44.396276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:44.540849Z","title":"Spice: Semantic propositional image caption evaluation,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:44.540849Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:be54e4ff4e7869e72c74a42ca9d87e9416f416d05fa97203b819d1ebf569d722","observation_id":"a6e42ce8-5d70-4ff8-aa4d-50510b04bfcf","resolution":{"observed_at":"2026-08-03T15:58:44.540849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-03T15:58:44.689645Z","title":"Microsoft coco captions: Data collection and evaluation server,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:44.689645Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:a7c25f236d0538e85850ada6fe5d22080ffebf328ab2657370640897ad4cdeeb","observation_id":"859d9eab-3db1-41e1-ba3b-7dd402a0489f","resolution":{"observed_at":"2026-08-03T15:58:44.689645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:44.779876Z","title":"Object hallucination in image captioning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:44.779876Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:eb90b752c3dd29af6e873a0c983c102930ba5e1d4feb974066bc5cbf581ddf84","observation_id":"7b66873d-7f5b-4589-87c2-a442f6340885","resolution":{"observed_at":"2026-08-03T15:58:44.779876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:44.927878Z","title":"Qwen2.5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:44.927878Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:bc200ef2759349d5745bbb5f8563542465ee7dbc7cb8f28a45c1f24e6678c46b","observation_id":"1be8a418-5a40-4999-92b7-4d625cd96c1e","resolution":{"observed_at":"2026-08-03T15:58:44.927878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:45.071155Z","title":"Lavis: A one-stop library for language-vision intelligence,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:45.071155Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:86aa5172ae4b219dff503d28ae43bf845b4ca05dee6f671abb16e3baea6add10","observation_id":"190abab3-4ce7-429e-bef2-5a0aea15d978","resolution":{"observed_at":"2026-08-03T15:58:45.071155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:45.133017Z","title":"Contrastive decoding: Open-ended text generation as optimization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:45.133017Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:5f23c083187c21f1427c2849323a758726ac9f7fed01d88ae9b950b462f07cc8","observation_id":"538ea23e-26e3-44e2-a0eb-e49213f25971","resolution":{"observed_at":"2026-08-03T15:58:45.133017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:45.191172Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:45.191172Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:f8d9c0a69cd539d1cd6f7ff213022160fc8833b946c0b31522f233739037e7fd","observation_id":"b7a02436-b676-4569-bbc7-dc62ff66ac12","resolution":{"observed_at":"2026-08-03T15:58:45.191172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:45.236756Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:45.236756Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:14db93e5bc067648a59ffd80eae87c445a4d0ca0975181f55c6a78cc486bdc07","observation_id":"0e804ed1-303f-4636-b22c-4ef2ca07f5ee","resolution":{"observed_at":"2026-08-03T15:58:45.236756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:45.274082Z","title":"Polos: Multimodal metric learning from human feedback for image captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:45.274082Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:f0c3c3e63145af44d6153bc29987cc6dc50d8b36b65ff360c08afed0abc39708","observation_id":"c9634422-e47d-4302-9abc-ce96e95942ad","resolution":{"observed_at":"2026-08-03T15:58:45.274082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:45.348828Z","title":"Aloha: A new measure for hallucination in captioning models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:45.348828Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:f006fc4e5583829706210e8d4cfaf084b701ac1f1682b7672061d53747a49aad","observation_id":"155d048a-4acf-4cef-bab2-d9934ed77f3e","resolution":{"observed_at":"2026-08-03T15:58:45.348828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:45.389280Z","title":"Capability: A comprehensive visual caption benchmark for evaluating both correctness and thoroughness,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:45.389280Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:b0c9efefe5552b7d68e8eab8ddb82b3a6f30bbd7752ab3e36d25b85904bae197","observation_id":"7658975b-aea7-4c18-a952-9f6c8d3b3fe0","resolution":{"observed_at":"2026-08-03T15:58:45.389280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T15:58:45.433734Z","title":"Test-time adaptation with clip reward for zero-shot generalization in vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T15:58:45.433734Z"},"links":{"citing_paper":"/paper/2607.28986"},"observation_digest":"sha256:3c0e8335c1af28013aff194cdb65bdfc43354371342964756a52b0fabda7d93d","observation_id":"ca09a6e9-fd12-4602-9da9-5fe930eade80","resolution":{"observed_at":"2026-08-03T15:58:45.433734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.28986","last_updated":"2026-07-31T03:27:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T05:46:32.260372Z","submitted_at":"2026-07-31T03:27:57Z","title":"Adjudicated Captioning: Multi-Agent Alignment Scoring and Consensus-Distilled Beam Arbitration for Strict Zero-Shot Image Captioning"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2607.28986."}