{"as_of":"2026-08-15T17:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9946f1877a264734bb5c227e379d7c1f492fd64f7810d3a1bd84ccd7a8061460","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T19:52:50.394161Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.11616/citation-record","integrity":"/paper/2508.11616/integrity","json":"/paper/2508.11616/citation-record.json","paper":"/paper/2508.11616"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T19:52:50.154994Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.154994Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:1a70ab6b6affd47f7cb40f7b186af91a4a5cc578dcff8937f69fb0621b7944d9","observation_id":"d1a4b941-605e-47a9-ab80-e1429cdd34d7","resolution":{"observed_at":"2026-08-05T19:52:50.154994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02477","last_updated":"2024-07-02T17:55:03Z","snapshot_observed_at":"2026-08-14T12:55:10.046641Z","submitted_at":"2024-07-02T17:55:03Z","title":"Understanding Alignment in Multimodal LLMs: A Comprehensive Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02477","snapshot_observed_at":"2026-08-05T19:52:50.159792Z","title":"Understand- ing alignment in multimodal llms: A comprehensive study","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.159792Z"},"links":{"cited_paper":"/paper/2407.02477","citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:cf38e4f182ff79e014e918d0c60ed1387a4adfc1a94ff91553617822068d075d","observation_id":"f1ba0cee-9f31-4e8b-a0fc-4456da44a26f","resolution":{"observed_at":"2026-08-05T19:52:50.159792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18930","snapshot_observed_at":"2026-08-05T19:52:50.164694Z","title":"Hallucination of multimodal large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.164694Z"},"links":{"cited_paper":"/paper/2404.18930","citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:0ccab2eef1073d5620044f36bddbf4b2c762f9f1cd3d32e815ffd014dcfc8350","observation_id":"9195a9d8-747a-4bec-887e-5f8ea3d54aba","resolution":{"observed_at":"2026-08-05T19:52:50.164694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-05T19:52:50.169620Z","title":"Paligemma: A versatile 3b vlm for trans- fer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.169620Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:86ce85f32f75e6ec2c4f41b32385f66dd5828122e86016c96389550008cfa500","observation_id":"c45988db-9f13-4a82-8f9f-bfc81ab5dda1","resolution":{"observed_at":"2026-08-05T19:52:50.169620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-08-12T23:57:02.109382Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-05T19:52:50.173749Z","title":"An introduction to vision-language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.173749Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:0936f26f63cf554344eb83e8386947cd034cf338ca3481534a1096b37a901c98","observation_id":"37c161bf-3b75-408d-9fc4-df691ab59ba6","resolution":{"observed_at":"2026-08-05T19:52:50.173749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:51.285082Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":"edf8ce97-c5ad-4d13-9f71-0d56901fd115","year":1952},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.178060Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:bfb66a9fde8f75a4d61d2bd055a1f513ad6e4105f07b31306c2c4672c1c40148","observation_id":"2e014888-65c9-4a83-a39c-9005d33696d5","resolution":{"observed_at":"2026-08-05T19:52:51.289356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-08-14T10:00:52.343929Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-05T19:52:50.181895Z","title":"Large language monkeys: Scaling inference compute with repeated sampling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.181895Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:3802b29c0ce162484462c3763a01c5bc90ec8acdda1f0ec2cddc663873b6326b","observation_id":"ef37e90e-3dbf-4593-9d25-0db8535f987b","resolution":{"observed_at":"2026-08-05T19:52:50.181895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-05T19:52:50.186179Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.186179Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:1641539d7886ae5e966392bc7ae32a109d5c6dac716fe05c91c5b59682df7a36","observation_id":"334f6ea5-faa9-4989-9a8a-1ab7459ff0ae","resolution":{"observed_at":"2026-08-05T19:52:50.186179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:50.189706Z","title":"The (r) evolution of multi- modal large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.189706Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:30fc5c8a0a53dd9f0303e094acf808cafddbdce751aec046ee868ccae0ef9b78","observation_id":"46ac2cda-50aa-4279-9c0f-b634d3061524","resolution":{"observed_at":"2026-08-05T19:52:50.189706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:51.274211Z","title":"End-to- end object detection with transformers","venue":null,"work_id":"1cd49d95-141b-4c4f-bb1d-64d4130d462d","year":2020},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.193277Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:35149265f4b4a8de068bc5b9c1f290b01f93540e791b3a31a00018316968797d","observation_id":"439aac8e-d30a-4625-ab01-fee4a7b80ec8","resolution":{"observed_at":"2026-08-05T19:52:51.277739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:51.261821Z","title":"Plug and play language models: A simple approach to controlled text generation","venue":null,"work_id":"887d5b1f-1756-4740-8c4f-a739cd8aa842","year":2020},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.197122Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:6cffefedd41c29a8c2f13e083a301a78983a853a959255ede5214515a63c0821","observation_id":"0d560a61-1267-4238-8b4c-a8e4fc62b192","resolution":{"observed_at":"2026-08-05T19:52:51.266435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15300","last_updated":"2024-04-23T09:32:25Z","snapshot_observed_at":"2026-08-15T00:58:22.157163Z","submitted_at":"2024-02-23T12:57:16Z","title":"Seeing is Believing: Mitigating Hallucination in Large Vision-Language Models via CLIP-Guided Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15300","snapshot_observed_at":"2026-08-05T19:52:50.201207Z","title":"Seeing is believing: Mitigating hallucination in large vision- language models via clip-guided decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.201207Z"},"links":{"cited_paper":"/paper/2402.15300","citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:24a7c5c4786c844de5db3b78c0ffe8894931e51783de7336f0a173b29870b3e1","observation_id":"d48f62ed-f031-4991-b33f-ff70f1455e3b","resolution":{"observed_at":"2026-08-05T19:52:50.201207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:51.250487Z","title":"Reward-augmented decod- ing: Efficient controlled text generation with a unidirectional reward model","venue":null,"work_id":"ded9233d-4de7-4c63-86d4-ecfb09ea62e7","year":2023},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.205481Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:b3395fe709cc07001854d9fd34fffa9cf27517af8d50ee11d346d6ad30b62a84","observation_id":"a0243cfc-04f9-4ed4-85e3-df8eba7f9d7a","resolution":{"observed_at":"2026-08-05T19:52:51.254427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T19:52:50.209103Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.209103Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:5c414f52ddd1e51ab439cc68d5c6a78850280746f58d2ec7a06a94df48a86646","observation_id":"d9812ea6-4b95-47ed-be5f-1e9a817c7c31","resolution":{"observed_at":"2026-08-05T19:52:50.209103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:51.238584Z","title":"Multi-modal hal- lucination control by visual information grounding","venue":null,"work_id":"f61e3230-a151-4193-876a-14ae814ca01a","year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.214263Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:668d2eb1de5e5127b3ef65ab8ed2772429b645f5d4b3aa0e74ea3123128cd4dc","observation_id":"1ff4a560-5341-427f-a45f-3b3a180ba014","resolution":{"observed_at":"2026-08-05T19:52:51.243172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06639","last_updated":"2024-05-10T17:59:04Z","snapshot_observed_at":"2026-08-15T00:40:05.076292Z","submitted_at":"2024-05-10T17:59:04Z","title":"Value Augmented Sampling for Language Model Alignment and Personalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06639","snapshot_observed_at":"2026-08-05T19:52:50.217899Z","title":"Value augmented sampling for language model alignment and personalization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.217899Z"},"links":{"cited_paper":"/paper/2405.06639","citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:7275f8c78582f345aa35a3752ea63aa1fae635af4fa8f4122a500bb9dcca5d12","observation_id":"76f764cb-197a-4e02-8bac-ad017610ec3a","resolution":{"observed_at":"2026-08-05T19:52:50.217899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:51.227526Z","title":"Sugarcrepe: Fixing hackable benchmarks for vision-language compositionality","venue":null,"work_id":"dd106d54-ca1d-4226-919e-8e0043f14bed","year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.222037Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:e28f9982d18a832c33f321538b2adfed2dbf28f24cff4a959bf89a0de6301edc","observation_id":"bd8a1b6f-a981-41f8-bc3d-56d9f6a80c33","resolution":{"observed_at":"2026-08-05T19:52:51.231390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:51.217318Z","title":"Lora: Low- rank adaptation of large language models","venue":null,"work_id":"168d4f16-3e66-4468-8d3f-68f2399aa31c","year":2022},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.225488Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:38b72529a0103fcfea2e2480fddff6857bbb875c802fe13ba5f1837edfedf09e","observation_id":"3e8ce828-3c3f-4b84-93ee-523f77de5faf","resolution":{"observed_at":"2026-08-05T19:52:51.220609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:51.206907Z","title":"Args: Alignment as reward-guided search","venue":null,"work_id":"d7dd5cf9-dd70-4a34-876f-e4c16cd2b183","year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.229886Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:aba8c0dc05b3c2d37765da795d7d6808bd8ce2b17a5f391431dc0673b4142b5c","observation_id":"826fd636-5466-42e6-addf-efbb1a1c091e","resolution":{"observed_at":"2026-08-05T19:52:51.210805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-15T03:01:41.971978Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T19:52:50.233278Z","title":"Rewardbench: Evaluating reward models for language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.233278Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:4de1892b5d783c664368f9d5cd0c98e48cc4fbd9efff5579fa30850f8898ae2c","observation_id":"b3ec0fdf-f59d-440d-9450-2477156f23d6","resolution":{"observed_at":"2026-08-05T19:52:50.233278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:51.196822Z","title":"Mitigating object hal- lucinations in large vision-language models through visual contrastive decoding","venue":null,"work_id":"95313b88-c0b4-4eac-8bf1-b5976b59540c","year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.237336Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:0e778bfe80ac1b5bcb318263cf77cd1f3db675d4aaca7bf90dd17a7abc7dc448","observation_id":"372d28b3-8d50-408a-8274-a70465e5fb1d","resolution":{"observed_at":"2026-08-05T19:52:51.200259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:51.186071Z","title":"Sequential monte carlo steering of large lan- guage models using probabilistic programs","venue":null,"work_id":"ac60176a-88c2-46cc-a5eb-b616dd185feb","year":2023},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.240846Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:d77b08e57ed7e5dd7c635661e19416ea3b7bc6e71279d45e26cdab293dce43b2","observation_id":"19bba8e2-9a60-4c24-98e9-d6aaad167b33","resolution":{"observed_at":"2026-08-05T19:52:51.190272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:51.173749Z","title":"Cascade reward sampling for efficient decoding-time align- ment","venue":null,"work_id":"432e0f17-8b8c-4289-a0e4-dbbb52d832b4","year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.245204Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:3f8955b74056223dd42f4bd12d0a83c885ca3388beb2109399310446896ee077","observation_id":"ef43729f-048b-4a7a-89d6-9bb851ee4dc9","resolution":{"observed_at":"2026-08-05T19:52:51.177822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:51.161857Z","title":"Vlfeedback: A large-scale ai feedback dataset for large vision-language models alignment","venue":null,"work_id":"2941ae11-0cd6-4296-a0a9-7fb72936f306","year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.248803Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:c262844d62b1c539b51045d9089af15c250fc9cf43df8468c3e5a13d5e85de91","observation_id":"58053729-0009-4ac4-bf4f-2ff1c2de74c5","resolution":{"observed_at":"2026-08-05T19:52:51.166165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:51.148057Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"b368c2e9-df11-4619-8faa-a5bddb524a57","year":2023},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.252401Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:cdf05873f0e11cf6f9d8f95f0dc3124734d0482e0423e48e35a55a47b3371b5a","observation_id":"67a17eee-0953-42c8-9389-3abfde6e5385","resolution":{"observed_at":"2026-08-05T19:52:51.153056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:51.136652Z","title":"Mitigating hallucination in large multi-modal models via robust instruction tuning","venue":null,"work_id":"3264a9a2-1b50-4c3d-b0f5-35a0397865a2","year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.256024Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:53ca05453df019894b8b90d2131852ee7a13cb8948e4327e684bd3554ead169a","observation_id":"6597e2da-aee1-4f69-a328-ff6636a2ded5","resolution":{"observed_at":"2026-08-05T19:52:51.140851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:51.124394Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"9c648f43-8765-4cd7-94df-caca5d37b713","year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.259630Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:05dba337e0b23cd54fc5fbf6e9911178f37e3a92636460c8d0f8db7fccad0dcc","observation_id":"29aaa85c-6b44-4b2f-87b7-622186dbcf1f","resolution":{"observed_at":"2026-08-05T19:52:51.128879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:51.111495Z","title":"Don’t throw away your value model! generating more preferable text with value-guided monte-carlo tree search decoding","venue":null,"work_id":"f494b59a-41ed-4c9d-8495-6931abb8a5e8","year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.263735Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:2eaada7b68e50c908d8a3e2370aa488a9f334ed2ec85657a8995116da8b4c39d","observation_id":"04e659d9-92b8-4c54-b0fa-96b3b42aafcd","resolution":{"observed_at":"2026-08-05T19:52:51.115433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:51.098905Z","title":"Investigating and mitigating object hallucinations in pretrained vision-language (clip) models","venue":null,"work_id":"c86b39cd-5613-474a-9b57-d2a32bd3cfa6","year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.267400Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:3d9bf2da1013da438af63e95950beff0a96fb4ada7d2225f6c25465c596c37d2","observation_id":"f205440f-a614-4cb6-a324-07957d941101","resolution":{"observed_at":"2026-08-05T19:52:51.103132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05299","snapshot_observed_at":"2026-08-05T19:52:50.271460Z","title":"Smolvlm: Redefining small and efficient multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.271460Z"},"links":{"cited_paper":"/paper/2504.05299","citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:71118e46385d90b366ad4aad6f0e730adf546a8418b9c4536d4f62eefd6cebfd","observation_id":"02a7cfff-3c27-4b07-ad5b-22851ff919eb","resolution":{"observed_at":"2026-08-05T19:52:50.271460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:51.086859Z","title":"Scaling open-vocabulary object detection","venue":null,"work_id":"1948a16c-bbbb-4c61-8188-37d846ee108a","year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.276395Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:093dad0f115ea098faec884b8f8bd4746d84fda29ab44c4d64bebba6da8b14fa","observation_id":"61c74f47-441a-413f-af26-9950f4aa96e3","resolution":{"observed_at":"2026-08-05T19:52:51.090677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:51.075199Z","title":"Controlled decod- ing from language models","venue":null,"work_id":"62e15b13-4ac6-4740-8da3-e6e20a76e7fc","year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.280460Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:b77497cd612557472a76175ac897949dec6fe2b60abcd9c0b4fdb61e50cd59da","observation_id":"942d4a95-69c1-4301-a756-35226a71d2fa","resolution":{"observed_at":"2026-08-05T19:52:51.079046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:51.063393Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"2b65ae46-31d4-4edf-b299-162d63f41538","year":2022},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.285603Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:b38cb684995105cf788112894caf9a807e111c323208b10cd1aa05ed660834c9","observation_id":"22c9f9d3-3275-46a8-8896-5c8e209054f7","resolution":{"observed_at":"2026-08-05T19:52:51.067203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:50.290201Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.290201Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:408af69ab84d025c50cdad292115f79d597ab603104c5fe9648141adb873cc73","observation_id":"53fa1001-81ea-4ce1-a5ef-a22c76750746","resolution":{"observed_at":"2026-08-05T19:52:50.290201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:51.046053Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"3aa9d9c5-03e9-4d4b-a22e-5d0edb7013bf","year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.295525Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:8c06aea79c2999adfb2cb188326c0a1c7b839a0790eca28736e0fb313dedb2f9","observation_id":"a7dcd835-ec49-40c6-82ba-5f5a96b0f0f8","resolution":{"observed_at":"2026-08-05T19:52:51.049641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2406.07780","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:50.729000Z","title":"A critical look at to- kenwise reward-guided text generation","venue":null,"work_id":"d663f97a-3c13-4a5f-b917-d5ab1310749b","year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.299628Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:24581e4a3c6ffb4ddca94ac114aa111a179232a63b3e04f66e249732fab99363","observation_id":"0f17a343-f98b-446c-878e-faeae2c5b3f3","resolution":{"observed_at":"2026-08-05T19:52:50.735262Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:51.034262Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks","venue":null,"work_id":"6639a485-1e7c-4bd8-97c4-497071a3ad82","year":2019},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.305083Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:4eafc7bcd4b69291005fa8a11333645e0a6672f36efe0ca65466f13232d46542","observation_id":"0dfb7e8f-4626-4524-b70f-0fed2ea3b02b","resolution":{"observed_at":"2026-08-05T19:52:51.038539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:51.021860Z","title":"Object hallucination in image cap- tioning","venue":null,"work_id":"3f00f856-1c53-4b0c-9d9a-e9645c087de3","year":2018},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.309903Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:657f6d4025c3a7b69c983c0c4500b10fa0a014820ff518367b66f1fd65269089","observation_id":"8fb41234-61de-4a1d-be41-294783ee2b63","resolution":{"observed_at":"2026-08-05T19:52:51.026452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18654","last_updated":"2025-02-28T00:26:42Z","snapshot_observed_at":"2026-08-15T02:23:48.727371Z","submitted_at":"2024-05-28T23:36:00Z","title":"Mitigating Object Hallucination in MLLMs via Data-augmented Phrase-level Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18654","snapshot_observed_at":"2026-08-05T19:52:50.314209Z","title":"Mitigating object hallucination via data augmented contrastive tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.314209Z"},"links":{"cited_paper":"/paper/2405.18654","citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:03f07656a46e4150bdaa386a3e083f219cabe543230ae60ed9e442af934442eb","observation_id":"38a8d27a-7220-42b2-932b-d2eb8fd01b5d","resolution":{"observed_at":"2026-08-05T19:52:50.314209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-05T19:52:50.318279Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.318279Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:05e1a18b10fd573ff97ebbc6df9c21f902eb20acd7aa49a9b990ffb93ca7aaf0","observation_id":"a8e5d578-55d5-4073-9049-6297fb93ae26","resolution":{"observed_at":"2026-08-05T19:52:50.318279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03555","last_updated":"2024-12-04T18:50:42Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:50:42Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03555","snapshot_observed_at":"2026-08-05T19:52:50.323102Z","title":"Paligemma 2: A family of versatile vlms for transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.323102Z"},"links":{"cited_paper":"/paper/2412.03555","citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:40e2a303ad96cfcbd40a94156e6d2d5cf752b96d35c478681a1507282a5c027a","observation_id":"ad339d84-e493-4831-89cc-7096e72b5e41","resolution":{"observed_at":"2026-08-05T19:52:50.323102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-05T19:52:50.327059Z","title":"Aligning large multi- modal models with factually augmented rlhf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.327059Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:2041a8b12d9081383acdc12657f47caf812210ef2b4c5d0f2eef613bf1efcbd1","observation_id":"bccd353f-0b69-4cef-9847-1bc0e1faafd3","resolution":{"observed_at":"2026-08-05T19:52:50.327059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T19:52:50.331059Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.331059Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:1ff99bf1037f86b6fc32499ff4f7b2a782068edc7e7bf9a5ba9561dd9e8103ab","observation_id":"e80dd9b1-5646-4091-99f2-c0e139688bce","resolution":{"observed_at":"2026-08-05T19:52:50.331059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02325","last_updated":"2024-03-04T18:55:30Z","snapshot_observed_at":"2026-08-13T04:03:44.039520Z","submitted_at":"2024-03-04T18:55:30Z","title":"Contrastive Region Guidance: Improving Grounding in Vision-Language Models without Training","version":1},"cited_work":{"arxiv_id":"2403.02325","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.02325","snapshot_observed_at":"2026-08-05T19:52:50.603278Z","title":"Contrastive Region Guidance: Improving Grounding in Vision-Language Models without Training","venue":"cs.CV","work_id":"0a75380b-17cf-4e13-94b3-f8608dbe6ff9","year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.335004Z"},"links":{"cited_paper":"/paper/2403.02325","citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:7dbbca4f2c33a38f707e9523142c94b095c9bd26abd6071d07e3818d64f9e1dd","observation_id":"b7c51513-c48c-4e4b-b0b8-a817735f8afd","resolution":{"observed_at":"2026-08-05T19:52:50.609153Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11839","last_updated":"2024-10-07T17:59:42Z","snapshot_observed_at":"2026-08-12T23:40:45.676888Z","submitted_at":"2024-06-17T17:59:58Z","title":"mDPO: Conditional Preference Optimization for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11839","snapshot_observed_at":"2026-08-05T19:52:50.338843Z","title":"mdpo: Conditional preference optimization for multimodal large language mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.338843Z"},"links":{"cited_paper":"/paper/2406.11839","citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:7686066d6dbff3e6d50cc53b0faaf342a0ad8afb2922795b433f8b197b9297fa","observation_id":"a82b1c07-6d07-4831-ad0d-e46326757cc6","resolution":{"observed_at":"2026-08-05T19:52:50.338843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07397","last_updated":"2024-02-23T07:54:11Z","snapshot_observed_at":"2026-08-14T15:48:28.214119Z","submitted_at":"2023-11-13T15:25:42Z","title":"AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07397","snapshot_observed_at":"2026-08-05T19:52:50.342468Z","title":"An llm-free multi-dimensional benchmark for mllms hallu- cination evaluation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.342468Z"},"links":{"cited_paper":"/paper/2311.07397","citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:923112fe6294781fc32310dd586989a27a8e5279fd8630c2b43b457908590ce7","observation_id":"f5bee5c2-4487-4ccc-a420-ecd5e506f822","resolution":{"observed_at":"2026-08-05T19:52:50.342468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:51.008409Z","title":"Fudge: Controlled text genera- tion with future discriminators","venue":null,"work_id":"d5fad07a-2b10-4764-9ed1-d1eaa62db4e4","year":2021},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.346126Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:3504cc30b708fd92364c60c626663a45bf13fe2f921b9032880415fbd9543ee8","observation_id":"e1387abe-36ad-4a24-8474-a8aa06df1608","resolution":{"observed_at":"2026-08-05T19:52:51.013349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16045","last_updated":"2024-12-11T02:46:29Z","snapshot_observed_at":"2026-08-13T05:41:56.516364Z","submitted_at":"2023-10-24T17:58:07Z","title":"Woodpecker: Hallucination Correction for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16045","snapshot_observed_at":"2026-08-05T19:52:50.351452Z","title":"Woodpecker: Hallucination correction for multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.351452Z"},"links":{"cited_paper":"/paper/2310.16045","citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:b786764c4652d1f83b5614cfc38f8a63953d3da25548bb75151d0addbddcb84e","observation_id":"1dadae72-8f9d-4a43-98a3-363fc9f4b752","resolution":{"observed_at":"2026-08-05T19:52:50.351452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:50.995423Z","title":"Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional hu- man feedback","venue":null,"work_id":"a7c3f1bf-151c-4c8f-862b-f1af2b1207a4","year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.355624Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:3b5f91daec87daa8d8facf3bf628a6f000d48a31ace1ea6612e924b31a50ebe0","observation_id":"84cbdba1-2f16-4ba6-b72f-98472b1082cb","resolution":{"observed_at":"2026-08-05T19:52:50.999855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:50.359220Z","title":"Rlaif-v: Aligning mllms through open-source ai feedback for super gpt-4v trustworthiness","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.359220Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:a33a677529c843f4570efab0a13e52c040b59eb3e369d62327a363f65c9e3437","observation_id":"ae856375-f6d8-44ce-8fe2-1619c0597096","resolution":{"observed_at":"2026-08-05T19:52:50.359220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14545","last_updated":"2024-05-29T05:55:09Z","snapshot_observed_at":"2026-08-15T00:58:20.496651Z","submitted_at":"2024-02-22T13:33:13Z","title":"Less is More: Mitigating Multimodal Hallucination from an EOS Decision Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14545","snapshot_observed_at":"2026-08-05T19:52:50.363102Z","title":"Less is more: Mitigat- ing multimodal hallucination from an eos decision perspec- tive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.363102Z"},"links":{"cited_paper":"/paper/2402.14545","citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:68def8d9deb2215928a4171be4d22747c1a2645d7502a3300b78ca13c6738271","observation_id":"2b6617e6-dee4-468c-9fce-02b3789331cf","resolution":{"observed_at":"2026-08-05T19:52:50.363102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06130","last_updated":"2025-09-09T18:19:31Z","snapshot_observed_at":"2026-08-15T05:30:21.338398Z","submitted_at":"2025-02-10T03:43:55Z","title":"Self-Correcting Decoding with Generative Feedback for Mitigating Hallucinations in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06130","snapshot_observed_at":"2026-08-05T19:52:50.367509Z","title":"Self- correcting decoding with generative feedback for mitigat- ing hallucinations in large vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.367509Z"},"links":{"cited_paper":"/paper/2502.06130","citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:2cee48c76107306ea7fa2771e50b3dd6811cc5c61dcf2fb9cdf993f8bfe8f42a","observation_id":"a10d5500-02b9-4cc8-b43e-a2fbc8b451a7","resolution":{"observed_at":"2026-08-05T19:52:50.367509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:50.980369Z","title":"Multimodal chain-of-thought reasoning in language models","venue":null,"work_id":"bbe70546-f952-41da-acb9-fac95199329b","year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.372458Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:966054482facd931f86acf2dccb087cfde22501b59fe4eea5c9096e621cd1616","observation_id":"2fbbeb2a-fc82-43fe-b537-59b5b329929d","resolution":{"observed_at":"2026-08-05T19:52:50.984480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08680","last_updated":"2025-06-11T21:33:21Z","snapshot_observed_at":"2026-08-13T04:19:36.609334Z","submitted_at":"2024-02-13T18:59:05Z","title":"Mitigating Object Hallucination in Large Vision-Language Models via Image-Grounded Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08680","snapshot_observed_at":"2026-08-05T19:52:50.376122Z","title":"Mitigating object hallucination in large vision- language models via classifier-free guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.376122Z"},"links":{"cited_paper":"/paper/2402.08680","citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:d4a78f0c5c8f7b4f21c2fd1f0f81e04d498fae6a198901825f9d49ae739137dd","observation_id":"9a6e7ddc-b304-4ad9-ba1e-0ff10c7e9035","resolution":{"observed_at":"2026-08-05T19:52:50.376122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16839","last_updated":"2024-02-06T16:43:31Z","snapshot_observed_at":"2026-08-08T04:17:23.797697Z","submitted_at":"2023-11-28T14:54:37Z","title":"Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16839","snapshot_observed_at":"2026-08-05T19:52:50.379966Z","title":"Beyond hallucinations: Enhanc- ing lvlms through hallucination-aware direct preference op- timization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.379966Z"},"links":{"cited_paper":"/paper/2311.16839","citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:7701a5e208d2026f9e6e2e76a5a83bb3c693804e2f130765e1a1890d0381d879","observation_id":"641aad0b-c7e6-4738-bd4b-3560e69da43c","resolution":{"observed_at":"2026-08-05T19:52:50.379966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:50.968417Z","title":"Aligning modalities in vision large lan- guage models via preference fine-tuning","venue":null,"work_id":"40de3572-c468-4a90-857d-b0c15521ebfb","year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.383630Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:f62c8c08cd00519d7d9498bbc8acc976ec06a6b693c119c569c440e129c21288","observation_id":"fa86e7c7-b053-4781-b60f-33adc81f7be3","resolution":{"observed_at":"2026-08-05T19:52:50.972910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:50.957910Z","title":"Analyzing and mitigating object hallucination in large vision-language models","venue":null,"work_id":"6865be40-663b-40f5-843a-d6a5f181ab8b","year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.386798Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:9b8c755f08dd1a6c1dd2aaefb641bfcff65b3f8e841ed3118e5d431843e3768a","observation_id":"5369d77b-72fb-4a3e-b16e-483daf65cdb6","resolution":{"observed_at":"2026-08-05T19:52:50.961526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14622","last_updated":"2024-11-02T02:51:51Z","snapshot_observed_at":"2026-08-15T11:57:17.434196Z","submitted_at":"2024-05-23T14:30:33Z","title":"Calibrated Self-Rewarding Vision Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14622","snapshot_observed_at":"2026-08-05T19:52:50.390184Z","title":"Calibrated self-rewarding vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.390184Z"},"links":{"cited_paper":"/paper/2405.14622","citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:0d88ba83c67a47c849ce1a6430a6c4df27f4cce0e70e6192baa60254cc7409c7","observation_id":"d23d70d0-a0c0-4148-8f1a-b3ad230b8e11","resolution":{"observed_at":"2026-08-05T19:52:50.390184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T19:52:50.947520Z","title":"Describe this image in detail","venue":null,"work_id":"5a5ce268-671a-46f8-ba17-b354e3b99a7f","year":null},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.394161Z"},"links":{"citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:72b6fb5b6556814f7c7c267de8597f6373ffe4f7216c9ad494394ef3cc12375d","observation_id":"9c058615-4b94-457e-9c0b-7ae63f453588","resolution":{"observed_at":"2026-08-05T19:52:50.950962Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T10:03:17.394030Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":2,"verified_fuzzy":28},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2508.11616."}