{"as_of":"2026-08-07T15:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d4734adb44e88b2ab18a71a4a877ff59992b24f857be131c7ac2da8127b7dd05","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:57:22.557555Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T16:38:51.797197Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T08:26:00.654417Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"cited_work":{"arxiv_id":"2506.15649","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.15649","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2506.15649 (2025)","venue":null,"work_id":"a1410013-0e01-4d8e-b270-46dc75c55c82","year":2025},"citing_paper":{"arxiv_id":"2604.09749","last_updated":"2026-04-10T11:01:48Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T11:01:48Z","title":"See Fair, Speak Truth: Equitable Attention Improves Grounding and Reduces Hallucination in Vision-Language Alignment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:51.797197Z"},"links":{"cited_paper":"/paper/2506.15649","citing_paper":"/paper/2604.09749"},"observation_digest":"sha256:8beac1c654b287f5126c99fb0aa19cbdff9dbf0ef03d4d11f68ab824e9390a7d","observation_id":"e0d91c50-46db-4b40-97dc-09cd1570a794","resolution":{"observed_at":"2026-05-11T08:26:00.656565Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.15649/citation-record","integrity":"/paper/2506.15649/integrity","json":"/paper/2506.15649/citation-record.json","paper":"/paper/2506.15649"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:57:19.314620Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:19.314620Z"},"links":{"citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:b14abdc4f7990d1d78a5afaf82d09be8b34b5f61e5d504b6f40d21618e528c3a","observation_id":"b3a0d8e4-1821-4a38-9110-cf15f90b77af","resolution":{"observed_at":"2026-08-06T23:57:19.314620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T23:57:19.351208Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities.arXiv preprint arXiv:2308.12966, 1(2):3, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:19.351208Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:f7481f6e612f6f46603c0fe33c29f931e107225e4137bf5461e61dc54bce480e","observation_id":"4387977e-f43e-4211-8819-1a8435f62ed2","resolution":{"observed_at":"2026-08-06T23:57:19.351208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18930","snapshot_observed_at":"2026-08-06T23:57:19.398994Z","title":"Hallucination of multimodal large language models: A survey.arXiv preprint arXiv:2404.18930, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:19.398994Z"},"links":{"cited_paper":"/paper/2404.18930","citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:812e84ccc8f4cef91944c26ea6158551837ec886bc005e273af5c113fe92ec3a","observation_id":"97e5e07f-fcfb-49e7-a6c9-e5a55985f41c","resolution":{"observed_at":"2026-08-06T23:57:19.398994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04513","last_updated":"2025-01-08T14:00:07Z","snapshot_observed_at":"2026-08-07T09:17:14.212086Z","submitted_at":"2025-01-08T14:00:07Z","title":"Improving Image Captioning by Mimicking Human Reformulation Feedback at Inference-time","version":1},"cited_work":{"arxiv_id":"2501.04513","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.04513","snapshot_observed_at":"2026-08-06T23:57:22.923946Z","title":"Improving Image Captioning by Mimicking Human Reformulation Feedback at Inference-time","venue":"cs.CV","work_id":"94eb384b-3352-4306-8583-e8768f00cea8","year":2025},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:19.479717Z"},"links":{"cited_paper":"/paper/2501.04513","citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:c22ef32c2dee26db0d3154da3b76160b22319fd62568b9b5c16c9f7515fe65a2","observation_id":"5f8edd4f-aead-46bc-8f9d-25f3de7ae660","resolution":{"observed_at":"2026-08-06T23:57:23.010234Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:57:19.569996Z","title":"Improving image generation with better captions.Computer Science","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:19.569996Z"},"links":{"citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:6233d9b3aaa4922eb4fa835df9259f69a8ff9c4aafcbbbc307e4f1b3c1102962","observation_id":"ea2a9ef5-92ed-4008-9584-8529a20b3389","resolution":{"observed_at":"2026-08-06T23:57:19.569996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-05T10:06:10.880743Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-06T23:57:19.619534Z","title":"Paligemma: A versatile 3b vlm for transfer.arXiv preprint arXiv:2407.07726, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:19.619534Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:7966c10663aa823fe88314f00fac26bb41dc58d87e7c93512cfa442018f4c0fb","observation_id":"c8f90c75-aef8-4146-8e3f-097f8e16b0da","resolution":{"observed_at":"2026-08-06T23:57:19.619534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-06T23:57:19.701437Z","title":"Large language monkeys: Scaling inference compute with repeated sampling.arXiv preprint arXiv:2407.21787, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:19.701437Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:d0eae8fadfd88fb24c7747a786ed92fae2c77e7bdee83dff44f1a4b49758cbae","observation_id":"ffb6c982-6d86-49ed-b1be-74d1a4f825fd","resolution":{"observed_at":"2026-08-06T23:57:19.701437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:57:24.203544Z","title":"Transfer q-star: Principled decoding for llm alignment.Advances in Neural Information Processing Systems, 37:101725–101761, 2024","venue":null,"work_id":"43a7f12a-d4ad-42ed-9274-2243cbfbfcea","year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:19.773228Z"},"links":{"citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:400de4b42e40dacf92346bb41fe45dc4e6202c3e0dce3e2e1d14347966d19f47","observation_id":"32b47546-e20b-42a8-82f6-4ea6ca981cfb","resolution":{"observed_at":"2026-08-06T23:57:24.240903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:57:19.841908Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:19.841908Z"},"links":{"citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:0918030d07983cb042109b1f35388c8673cd26e639efcab2412189a886156c2c","observation_id":"c7a7959a-32c5-4ef5-893f-980207911ae5","resolution":{"observed_at":"2026-08-06T23:57:19.841908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-06T23:57:19.883212Z","title":"Are we on the right way for evaluating large vision-language models?arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:19.883212Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:9e96f1983d2b7acaadf3a044153e17e8eba6826ecd23af46bf7b471d37da5583","observation_id":"a16795af-8bba-4a70-91b0-976e0e609a9d","resolution":{"observed_at":"2026-08-06T23:57:19.883212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:57:19.973475Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:19.973475Z"},"links":{"citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:94c7b94a105e946f14801edffb5ee6b88e543613ed088126498f74ccc6822ccb","observation_id":"b5109b54-d3fc-4f05-8b12-37b10a87a8aa","resolution":{"observed_at":"2026-08-06T23:57:19.973475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16479","last_updated":"2023-11-27T09:30:02Z","snapshot_observed_at":"2026-07-06T16:53:35.776613Z","submitted_at":"2023-11-27T09:30:02Z","title":"Mitigating Hallucination in Visual Language Models with Visual Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16479","snapshot_observed_at":"2026-08-06T23:57:20.052718Z","title":"Mit- igating hallucination in visual language models with visual supervision.arXiv preprint arXiv:2311.16479, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:20.052718Z"},"links":{"cited_paper":"/paper/2311.16479","citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:3dafcda12dec620620ed3b10e406010a02dba010dc314b38ba7dcdf3858d0494","observation_id":"a8ac9528-9e73-42c8-9331-30088b03dc91","resolution":{"observed_at":"2026-08-06T23:57:20.052718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:57:24.078821Z","title":"Partially non-autoregressive image captioning","venue":null,"work_id":"b0e28524-6dcc-4b09-8e72-d45b2b50caaf","year":2021},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:20.088656Z"},"links":{"citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:3aa86603844789eeca8e1b72789deda22cf5467a882cbd0eb4235b645e037bad","observation_id":"312f131d-840f-4bf8-91b6-405b875d5e18","resolution":{"observed_at":"2026-08-06T23:57:24.146107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:57:20.164694Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:20.164694Z"},"links":{"citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:4ca0c4cb9988300d664b5a6fd59d22270b9c4eed9875112a1666ec3d51465afe","observation_id":"badfbf07-825b-46b9-ab67-e9aa76ea2750","resolution":{"observed_at":"2026-08-06T23:57:20.164694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:57:23.994044Z","title":"From images to textual prompts: Zero-shot visual question answering with frozen large language models","venue":null,"work_id":"e6b81054-f8f1-4603-ab0e-d216973501dd","year":2023},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:20.230133Z"},"links":{"citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:12f94ef6988665b269441e8778f7dcfe7e6847ce34086026831c9acb398ad1f8","observation_id":"2fd181c1-01f0-4488-b6ba-9ebc6bc22ed1","resolution":{"observed_at":"2026-08-06T23:57:24.026884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:57:23.896785Z","title":"A hierarchical approach for generating descriptive image paragraphs","venue":null,"work_id":"a9dfea2d-3ee1-4bf4-a33b-32ae8bcbf348","year":2017},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:20.267102Z"},"links":{"citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:cc6e6c0daa3bd171d9b9e7414efe90ade55b2decdc02b6fd705d20ec8b11cb0c","observation_id":"baa8ed80-8e2f-4d1d-a509-02891df79859","resolution":{"observed_at":"2026-08-06T23:57:23.943653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:57:20.342916Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:20.342916Z"},"links":{"citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:b0cdc9b4bdc6428bd71771523c9a27bcc9da9b8d6c348926b8b39a87c7322171","observation_id":"b8aad40e-88c7-4639-bb20-8120b7c18a1f","resolution":{"observed_at":"2026-08-06T23:57:20.342916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:57:23.799302Z","title":"Coco-cn for cross-lingual image tagging, captioning, and retrieval.IEEE Transactions on Multimedia, 21(9):2347–2360, 2019","venue":null,"work_id":"0fc08826-5b07-4c2a-a510-2bca8679a323","year":2019},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:20.429119Z"},"links":{"citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:f93e4a227621a5c4b7ba0846a9485ca8f9027ec0759baa7daa6d06ba3d4a8484","observation_id":"9799f53a-05cd-4ff7-ba67-53558097a6cf","resolution":{"observed_at":"2026-08-06T23:57:23.836349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:57:20.468101Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:20.468101Z"},"links":{"citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:02f45f0abd20e9098c65a9ddb1efe9170fcd81f94a801b26db31ec2baed81968","observation_id":"fff19fa4-3208-4752-b9a2-b4b0568f9195","resolution":{"observed_at":"2026-08-06T23:57:20.468101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-06T23:57:20.520182Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model.arXiv preprint arXiv:2405.04434, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:20.520182Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:e021b1ced38acae8dffef2985273731d0ee74114c3720b3ac5fe170315d2addb","observation_id":"0ada43e7-ed5c-4ea4-b2f9-f633f5b67dea","resolution":{"observed_at":"2026-08-06T23:57:20.520182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-06T22:33:34.254048Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-06T23:57:20.613758Z","title":"Mitigating hallucination in large multi-modal models via robust instruction tuning.arXiv preprint arXiv:2306.14565, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:20.613758Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:bcd6ff0f88a0acf63d504555f535445748ff25f935d9106acb1d12ec8b5511b2","observation_id":"7f11a5f8-2f89-42b1-ab94-beb7b8a371f1","resolution":{"observed_at":"2026-08-06T23:57:20.613758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:57:20.681130Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:20.681130Z"},"links":{"citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:c16ec3854e76132b0936f93a7e41c3de7397a23d350825c2dc5b28a62cb72b4d","observation_id":"91f2a0fe-604b-432c-bcb3-1d95858b90b1","resolution":{"observed_at":"2026-08-06T23:57:20.681130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:57:20.729906Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:20.729906Z"},"links":{"citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:e7a4f12d6e6c8958138ffc90c1afacb892de1e04d8d00b4e405179ee6f53a328","observation_id":"18677114-1d80-410a-a179-95fa8b187deb","resolution":{"observed_at":"2026-08-06T23:57:20.729906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:57:20.762953Z","title":"Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:20.762953Z"},"links":{"citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:b5bf6af8fdbc09c8782c14b881280f5b2382e1675ff89d93fb716c1ca161526b","observation_id":"25a2a333-4f8a-4cc7-b44f-1d2f49254ae2","resolution":{"observed_at":"2026-08-06T23:57:20.762953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-06T23:57:20.836219Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts.arXiv preprint arXiv:2310.02255, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:20.836219Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:0813a0cf1decd7a31a669ec7ba873fa8ab8bc4c0a142b612c555bbc67ed0a679","observation_id":"4604e7ca-aa56-4c33-8770-07fa0d09d579","resolution":{"observed_at":"2026-08-06T23:57:20.836219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08358","last_updated":"2024-01-16T13:36:07Z","snapshot_observed_at":"2026-08-02T18:11:15.350481Z","submitted_at":"2024-01-16T13:36:07Z","title":"Hallucination Detection and Hallucination Mitigation: An Investigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08358","snapshot_observed_at":"2026-08-06T23:57:20.923852Z","title":"Hallucination detection and hallucination mitigation: An investigation.arXiv preprint arXiv:2401.08358, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:20.923852Z"},"links":{"cited_paper":"/paper/2401.08358","citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:b603fb0f6e6e3370a68f440f86ec8703a35d1ffd16d01999addb296c92583983","observation_id":"bada4063-79d4-4fb4-8989-5b7a52968bdd","resolution":{"observed_at":"2026-08-06T23:57:20.923852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:57:23.641997Z","title":"Training for diversity in image paragraph captioning","venue":null,"work_id":"1c0da533-f3a4-49b2-841f-f56f0e01214a","year":2018},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:20.960011Z"},"links":{"citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:0eeb992ad7f21572efe1d10fe314ac018c6dc1a8a162e6f20d1ab1ffaece2093","observation_id":"9f9aa8c8-0eec-4fef-8209-be6c9066edff","resolution":{"observed_at":"2026-08-06T23:57:23.668793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:57:23.491696Z","title":"Learning to reason with llms","venue":null,"work_id":"21d29377-7fa3-4f67-873b-028b5a623dd6","year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:21.029431Z"},"links":{"citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:6fa0cea0b9e456e2479f8555e9bc60bf77ae501865fb78e13e2b3155f1d64b82","observation_id":"c971c67b-3347-43c6-ade0-6c746d2c4b06","resolution":{"observed_at":"2026-08-06T23:57:23.557590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:57:23.384509Z","title":"Self-critical sequence training for image captioning","venue":null,"work_id":"6d06b201-a8b5-4a01-9c70-406fbeb272db","year":2017},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:21.106679Z"},"links":{"citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:3bcb2d27cf1beb46ea5d0fdd06aa0e904208bca98c8c6b935f10c88c8d09809d","observation_id":"e4cbf877-9d8f-4e75-b4b5-059dfa50bd70","resolution":{"observed_at":"2026-08-06T23:57:23.445809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02156","last_updated":"2019-03-29T23:48:52Z","snapshot_observed_at":"2026-08-04T05:57:07.163978Z","submitted_at":"2018-09-06T18:25:18Z","title":"Object Hallucination in Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02156","snapshot_observed_at":"2026-08-06T23:57:21.157328Z","title":"Object hallucination in image captioning.arXiv preprint arXiv:1809.02156, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:21.157328Z"},"links":{"cited_paper":"/paper/1809.02156","citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:b82b16230775be4ec10a7834b8f9f05fcef36ffb6183660329fd8b0ae41b89c7","observation_id":"01b005c7-93ab-47be-a9ff-667ac89ae176","resolution":{"observed_at":"2026-08-06T23:57:21.157328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:57:23.260426Z","title":"Mastering the game of go with deep neural networks and tree search.nature, 529(7587):484–489, 2016","venue":null,"work_id":"c1650fe9-1fa8-4347-9726-9f6bfd91df8b","year":2016},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:21.186831Z"},"links":{"citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:c81458fb53d2ddfb4b690bbe9c899f8d44608c6db2d0f3eeb0aa32f7dc2d89eb","observation_id":"9f52c8c8-8e9a-42a8-ba63-7d0a5387edbb","resolution":{"observed_at":"2026-08-06T23:57:23.291456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-06T23:57:21.272982Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters.arXiv preprint arXiv:2408.03314, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:21.272982Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:e77ad9c99d4edac0704b1821a72167609f2aaf1c55c1a5ca6919e234f555cd92","observation_id":"22104888-65fe-4ced-bb63-bfa195d2538e","resolution":{"observed_at":"2026-08-06T23:57:21.272982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10457","last_updated":"2024-07-15T06:12:17Z","snapshot_observed_at":"2026-07-06T18:46:18.540571Z","submitted_at":"2024-07-15T06:12:17Z","title":"The Good, The Bad, and The Greedy: Evaluation of LLMs Should Not Ignore Non-Determinism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10457","snapshot_observed_at":"2026-08-06T23:57:21.346054Z","title":"The good, the bad, and the greedy: Evaluation of llms should not ignore non-determinism.arXiv preprint arXiv:2407.10457, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:21.346054Z"},"links":{"cited_paper":"/paper/2407.10457","citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:85ec18d17a33f25d554d0f761f186a5d39f118561a7f4bcea799a4ff096aedb6","observation_id":"2083ec24-9664-4998-aa1a-381b6a7f2f86","resolution":{"observed_at":"2026-08-06T23:57:21.346054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-06T23:57:21.395412Z","title":"Aligning large multimodal models with factually augmented rlhf.arXiv preprint arXiv:2309.14525, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:21.395412Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:a8f7e77dff54a48ec8ab885bda8276064807850fae9b37457d9bfbf581d1708a","observation_id":"2badc4ec-3dd1-4000-acef-6cc333f5ca9b","resolution":{"observed_at":"2026-08-06T23:57:21.395412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:57:23.131586Z","title":"Learning to predict by the methods of temporal differences.Machine learning, 3:9–44, 1988","venue":null,"work_id":"d6937283-2239-423c-a3db-ba355a137ae6","year":1988},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:21.483237Z"},"links":{"citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:2c6c3e830186a05577d1ee55f8b34dd4eaf56c3d5983a185584df97957f38c66","observation_id":"4a53ce7c-c36b-49f2-a117-8438ed88c61c","resolution":{"observed_at":"2026-08-06T23:57:23.199958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:57:21.554884Z","title":"Toward self-improvement of llms via imagination, searching, and criticizing.Advances in Neural Information Processing Systems, 37:52723–52748, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:21.554884Z"},"links":{"citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:86b8f026e8c0f119772fe8ca92db0d9bc7b84bc9eec4d84c406c0371926992c8","observation_id":"6161da9a-0e05-440f-8652-c9dc3507250c","resolution":{"observed_at":"2026-08-06T23:57:21.554884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:57:21.596476Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms.Advances in Neural Information Processing Systems, 37:87310–87356, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:21.596476Z"},"links":{"citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:002882429a4be8bf728447fc0ce160942cabaabf95ba86b166226e567426818d","observation_id":"eed26693-5325-4bc2-8f2d-dfd8fae7300d","resolution":{"observed_at":"2026-08-06T23:57:21.596476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-06T23:57:21.698625Z","title":"Solving math word problems with process-and outcome-based feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:21.698625Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:4c3b319920f230c1bf432e364677d2483490a56bb5237e712eaa0242689f10e3","observation_id":"958661bd-7dfd-4d18-b87e-2c3dfbd1adad","resolution":{"observed_at":"2026-08-06T23:57:21.698625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03278","last_updated":"2023-03-06T16:49:27Z","snapshot_observed_at":"2026-07-06T14:59:14.951471Z","submitted_at":"2023-03-06T16:49:27Z","title":"Faithfulness-Aware Decoding Strategies for Abstractive Summarization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03278","snapshot_observed_at":"2026-08-06T23:57:21.762431Z","title":"Faithfulness-aware decoding strategies for abstractive summarization.arXiv preprint arXiv:2303.03278, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:21.762431Z"},"links":{"cited_paper":"/paper/2303.03278","citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:37a8d2dd5a7b81b365772739f9d6c4ecfda885ee8fe8f949a6381f4408c1a3ac","observation_id":"6b86856d-6d8d-41c2-b1f6-810e68495616","resolution":{"observed_at":"2026-08-06T23:57:21.762431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00320","last_updated":"2024-06-29T05:14:04Z","snapshot_observed_at":"2026-08-06T10:09:18.664387Z","submitted_at":"2024-06-29T05:14:04Z","title":"LiteSearch: Efficacious Tree Search for LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00320","snapshot_observed_at":"2026-08-06T23:57:21.815062Z","title":"Litesearch: Efficacious tree search for llm.arXiv preprint arXiv:2407.00320, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:21.815062Z"},"links":{"cited_paper":"/paper/2407.00320","citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:2f31a7d998daba70bb99d2d1d810cf79fd7f3bb78f10bbd9c7e23b0184c0f940","observation_id":"c3f05ff3-ff21-47a7-97b6-7bcc71065d9e","resolution":{"observed_at":"2026-08-06T23:57:21.815062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T23:57:21.877950Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:21.877950Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:9ccdd8e84c2495c905eaf84f3ac9e3c7f1203e34fb05ce898bff2c323f3d0064","observation_id":"ced584f3-ad29-4fc9-98b9-c08ac9daf041","resolution":{"observed_at":"2026-08-06T23:57:21.877950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:57:21.930665Z","title":"Cogvlm: Visual expert for pretrained language models.Advances in Neural Information Processing Systems, 37:121475–121499, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:21.930665Z"},"links":{"citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:6c7945193a97b3041201d411fab6c24dca1b9839f4b56e6a633f83d15eac98b0","observation_id":"d31f81cc-df1b-4f30-9124-8d52316a7691","resolution":{"observed_at":"2026-08-06T23:57:21.930665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18715","last_updated":"2024-06-05T13:53:42Z","snapshot_observed_at":"2026-07-06T17:52:00.714976Z","submitted_at":"2024-03-27T16:04:47Z","title":"Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18715","snapshot_observed_at":"2026-08-06T23:57:21.985073Z","title":"Mitigating hallucinations in large vision- language models with instruction contrastive decoding.arXiv preprint arXiv:2403.18715, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:21.985073Z"},"links":{"cited_paper":"/paper/2403.18715","citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:748e2a396b2eedffa0e08fe2df1892792dd1424b0872fcd597a0bbec1d5aac6d","observation_id":"4b54e66f-c402-4f47-a302-c723e16ab620","resolution":{"observed_at":"2026-08-06T23:57:21.985073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03704","last_updated":"2025-06-30T20:29:34Z","snapshot_observed_at":"2026-08-07T11:33:34.159217Z","submitted_at":"2024-12-04T20:35:07Z","title":"Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03704","snapshot_observed_at":"2026-08-06T23:57:22.096140Z","title":"Scaling inference-time search with vision value model for improved visual comprehension.arXiv preprint arXiv:2412.03704, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:22.096140Z"},"links":{"cited_paper":"/paper/2412.03704","citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:5cc939709ef41aee0455b58406bf361845dc8ecc75355b2979433766dc11c342","observation_id":"6add957d-08f8-48a0-9bdf-d3f310ccc30a","resolution":{"observed_at":"2026-08-06T23:57:22.096140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10529","last_updated":"2024-01-25T04:11:57Z","snapshot_observed_at":"2026-07-06T17:17:44.177514Z","submitted_at":"2024-01-19T07:10:13Z","title":"Mementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image Sequences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10529","snapshot_observed_at":"2026-08-06T23:57:22.137629Z","title":"Mementos: A comprehensive benchmark for multimodal large language model reasoning over image sequences.arXiv preprint arXiv:2401.10529, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:22.137629Z"},"links":{"cited_paper":"/paper/2401.10529","citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:4f0282a0023763723da9a52a2d591e12b1d9a1b4afacc97514759d7378abc8bb","observation_id":"7b28090b-ee75-4c24-8f16-201a27e47f49","resolution":{"observed_at":"2026-08-06T23:57:22.137629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-06T23:57:22.189577Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding.arXiv preprint arXiv:2412.10302, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:22.189577Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:bca95964c83bcabb2ca309fac5ae72a0bc51bbd8c5f3994694452517f8868398","observation_id":"da741311-9950-4199-9b67-7ce3d572503b","resolution":{"observed_at":"2026-08-06T23:57:22.189577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02712","last_updated":"2025-03-04T00:49:07Z","snapshot_observed_at":"2026-08-06T04:32:16.849942Z","submitted_at":"2024-10-03T17:36:33Z","title":"LLaVA-Critic: Learning to Evaluate Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02712","snapshot_observed_at":"2026-08-06T23:57:22.277104Z","title":"Llava-critic: Learning to evaluate multimodal models.arXiv preprint arXiv:2410.02712, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:22.277104Z"},"links":{"cited_paper":"/paper/2410.02712","citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:46443fa0fa7f23e0122a4124d5ee929299f6b86d8f63919ee95653f87dbcd1a7","observation_id":"d599e882-1779-426b-a9c6-f0a1c124310d","resolution":{"observed_at":"2026-08-06T23:57:22.277104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-06T23:57:22.318324Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:22.318324Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:809f2e12c69b0b7dc1231457d132b8521d0cfd31002dfb461963e942cb2dadd3","observation_id":"8a27f66c-70d5-462d-807b-3844fd4a638c","resolution":{"observed_at":"2026-08-06T23:57:22.318324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-06T23:57:22.370183Z","title":"Coca: Contrastive captioners are image-text foundation models.arXiv preprint arXiv:2205.01917, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:22.370183Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:008ef19491abb222646adeffbf0eebb739442601965bedbea90d98ede884d084","observation_id":"b11da14d-8979-476d-9afb-88e9fc4db042","resolution":{"observed_at":"2026-08-06T23:57:22.370183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-06T13:03:19.727877Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-06T23:57:22.453247Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities.arXiv preprint arXiv:2308.02490, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:22.453247Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:5ce55ab1000cedc7e08a102469b96e3a1c0e2fcb7ec021ddef9413f6138fee49","observation_id":"d656ce03-b75d-4f32-9ef3-e11324724b83","resolution":{"observed_at":"2026-08-06T23:57:22.453247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:57:22.498077Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:22.498077Z"},"links":{"citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:31dd45e43786c704b750c2ffd2c057c441b06fdd531ebac48ff38b4d4492fc4e","observation_id":"6a7d0348-bef1-47bd-aac9-8be53d539b74","resolution":{"observed_at":"2026-08-06T23:57:22.498077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:57:22.527750Z","title":"Rest-mcts*: Llm self-training via process reward guided tree search.Advances in Neural Information Processing Systems, 37:64735–64772, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:22.527750Z"},"links":{"citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:4c66089e5fc4b75b993616dee9b02d0dc657678093cbc51699a2d6a4ba069155","observation_id":"ba057781-2d4e-43f2-ad73-e77052e5b73c","resolution":{"observed_at":"2026-08-06T23:57:22.527750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14622","last_updated":"2024-11-02T02:51:51Z","snapshot_observed_at":"2026-07-30T21:22:18.339303Z","submitted_at":"2024-05-23T14:30:33Z","title":"Calibrated Self-Rewarding Vision Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14622","snapshot_observed_at":"2026-08-06T23:57:22.557555Z","title":"Calibrated self-rewarding vision language models.arXiv preprint arXiv:2405.14622, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:22.557555Z"},"links":{"cited_paper":"/paper/2405.14622","citing_paper":"/paper/2506.15649"},"observation_digest":"sha256:661d82036e1fbecf2e7a3f0e5846f0fa2c9b2595a8f62052fc4a988f56f3464e","observation_id":"d78dd73f-5a7f-462e-bac7-f4792db5b05d","resolution":{"observed_at":"2026-08-06T23:57:22.557555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.15649","last_updated":"2025-06-18T17:23:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T09:16:49.443338Z","submitted_at":"2025-06-18T17:23:36Z","title":"Dual-Stage Value-Guided Inference with Margin-Based Reward Adjustment for Fast and Faithful VLM Captioning"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":1,"verified_fuzzy":10},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 1 inbound Pith citation observation for arXiv:2506.15649."}