{"as_of":"2026-08-08T22:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:23e498e5d7f2ed02e94c43f4135c71f11df04e4212e9f451921f8e32284d0f06","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:18:38.304903Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T13:29:33.614965Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T13:33:28.064115Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"cited_work":{"arxiv_id":"2508.20181","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20181","snapshot_observed_at":"2026-06-29T13:33:28.064115Z","title":null,"venue":null,"work_id":"83ad2f31-9327-4193-92fc-4ca333a3abf4","year":2025},"citing_paper":{"arxiv_id":"2605.27993","last_updated":"2026-05-27T05:33:06Z","snapshot_observed_at":"2026-08-02T18:16:52.435185Z","submitted_at":"2026-05-27T05:33:06Z","title":"Rethinking Visual Neglect: Steering via Context-Preference for MLLM Hallucination Mitigation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-29T13:29:33.614965Z"},"links":{"cited_paper":"/paper/2508.20181","citing_paper":"/paper/2605.27993"},"observation_digest":"sha256:d8cafdb2716b5386034b21776e66ddf1c07cc61876d10c4085a9d87b626c1e45","observation_id":"52162736-4518-4fe8-a41c-cfd720d0e08f","resolution":{"observed_at":"2026-06-29T13:33:28.065432Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.20181/citation-record","integrity":"/paper/2508.20181/integrity","json":"/paper/2508.20181/citation-record.json","paper":"/paper/2508.20181"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T15:18:33.237590Z","title":"Qwen-VL: A Versatile Vision-Language Model for Un- derstanding, Localization, Text Reading, and Beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:33.237590Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:aeccc0d7208a6542c549b1505d2805fca3077008b76f239033e5f6c1e1a8bcf1","observation_id":"86fa58ad-9fef-468b-8454-9981aceb40a5","resolution":{"observed_at":"2026-08-05T15:18:33.237590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18930","snapshot_observed_at":"2026-08-05T15:18:33.324613Z","title":"Hallucination of Multimodal Large Language Models: A Survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:33.324613Z"},"links":{"cited_paper":"/paper/2404.18930","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:f057b9765d0f1428532175df9fba7771f2f7cb50626384e30b5ed49cd485caa8","observation_id":"30c65b2a-8c2a-4420-9b05-6500010b9090","resolution":{"observed_at":"2026-08-05T15:18:33.324613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:46.559094Z","title":"With a Little Help from your own Past: Prototypical Memory Networks for Image Captioning","venue":null,"work_id":"28cd6fa4-6f11-44c6-b81f-2b5863c4439f","year":2023},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:33.368982Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:8f80f6857fd6e43ae1f6e48ef3b28298190d6e47c6aaa11955d1461206a2438b","observation_id":"4ae0cf45-190a-474b-87e3-2f62f86ec140","resolution":{"observed_at":"2026-08-05T15:18:46.651646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:46.349361Z","title":"The Revolution of Multimodal Large Language Models: A Survey","venue":null,"work_id":"44003167-cde5-45bd-82e6-ccbd3205e8e0","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:33.438837Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:c07b604b0e68de1a9d0592e89766a2f35e8f044329984362f867d00ecf0019f2","observation_id":"1659d00d-a5ac-46c0-9207-c1b612038898","resolution":{"observed_at":"2026-08-05T15:18:46.443655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:46.213272Z","title":"End-to-End Object Detection with Transformers","venue":null,"work_id":"3e736034-6b3e-4297-9cb3-6baf84e03c92","year":2020},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:33.537393Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:c505408588a66578263f9e8b24a1942234846aa7c90293cb16bd0b96ee85dd99","observation_id":"9bfb76dc-749f-4a03-abd1-e54c319ce65d","resolution":{"observed_at":"2026-08-05T15:18:46.285354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-05T15:18:33.646628Z","title":"Shikra: Unleashing Multimodal LLM’s Referential Dialogue Magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:33.646628Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:51fbc66159821372804e816f52a9c4c87f5cb1b0b601f449e6fc8e10666e2046","observation_id":"b9ab9a6f-c19c-4e72-832d-1e18dfcb6fda","resolution":{"observed_at":"2026-08-05T15:18:33.646628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:46.083628Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"132b8253-f7ed-4303-a0dd-4c5d14c59e34","year":null},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:33.725432Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:b356927e17c236fbf85110a6e77622ceea2acdfc0d371194e4adce20976b37ab","observation_id":"de52eb4e-5928-4687-a62e-82d6be2a150c","resolution":{"observed_at":"2026-08-05T15:18:46.139959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:45.772722Z","title":"DoLa: Decoding by Contrasting Layers Improves Factuality in Large Language Models","venue":null,"work_id":"3000f700-f0c5-4814-9280-887033381aa6","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:33.892444Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:5ff65c1fdf185d8bca03bae6edde4712b4bf031e4b8563d1de84550b71d06c60","observation_id":"a864a7fd-65c0-4e08-a6ee-f8308d2cb009","resolution":{"observed_at":"2026-08-05T15:18:45.818209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:45.629708Z","title":"LLaV A-MORE: A Comparative Study of LLMs and Visual Backbones for Enhanced Visual Instruction Tuning","venue":null,"work_id":"6643675b-838a-4db2-8bc6-704aa8ece94c","year":2025},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:33.975071Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:7e329d9747ac3a63ad395fe8a02b826b17ac3716fedb2d65b414b5fcdf4c3978","observation_id":"409edc50-62c0-4faf-b294-d9d658422371","resolution":{"observed_at":"2026-08-05T15:18:45.699335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-05T15:18:34.027368Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.027368Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:65cc26953d980598bf655d817f68ae80c88b05a101e383f1e8351105ae48656e","observation_id":"85874f6f-1ea4-42e8-988f-1fd23bfac7d8","resolution":{"observed_at":"2026-08-05T15:18:34.027368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T15:18:34.097678Z","title":"The Llama 3 Herd of Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.097678Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:a2b06dea26bc0af585d39aeca5f6b188ac6ec90ddddc90636a4d87d94d5c8aad","observation_id":"bbfcb825-8c4e-4243-9022-cddcb6cf1bfb","resolution":{"observed_at":"2026-08-05T15:18:34.097678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-05T15:18:34.147013Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.147013Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:72e4ccb9edf3746f110b670c874fc7978ce32092535150f830824fba2fe65d8e","observation_id":"26692736-0744-4ec6-ab86-8691a51495b5","resolution":{"observed_at":"2026-08-05T15:18:34.147013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:45.493455Z","title":"OneLLM: One Framework to Align All Modalities with Language","venue":null,"work_id":"c3bb45e7-eccc-45af-b24e-74c66a61d196","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.201914Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:9d0a8a5536c036e523430a4e273569f422ae596429be5a45764ebc935966c273","observation_id":"975ac317-3c2a-4179-bac7-21f7b5ddf0c3","resolution":{"observed_at":"2026-08-05T15:18:45.558840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:45.308733Z","title":"ORPO: Monolithic Preference Optimization without Reference Model","venue":null,"work_id":"2ae2c0f7-a22c-48d1-8741-81350b38ac08","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.264082Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:41afcaae1e3adb7cbad50e16f3ed93b917a823ede31c1612bb667e9d34f2715c","observation_id":"48bc36a0-c4c1-4021-a769-7251e75154b0","resolution":{"observed_at":"2026-08-05T15:18:45.415876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-05T15:18:34.315829Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.315829Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:26ba24a59db52b49987ef000fd4e047fdadfe554d86ee2598049efaf23ad9dd5","observation_id":"71a0e014-6121-40c8-bc06-53f4ad4b5d69","resolution":{"observed_at":"2026-08-05T15:18:34.315829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:45.102602Z","title":"A Survey on Hal- lucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","venue":null,"work_id":"f26851fc-c186-4bb1-a6bf-8d8e799851e1","year":2025},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.371606Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:62b1ab7eaa6915bf2d1139a8d60739d5c8694e228393cf0ef99e73895bfd9300","observation_id":"7a7bfd4f-cb9f-4325-bd30-aaf09ad67403","resolution":{"observed_at":"2026-08-05T15:18:45.197572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:44.941165Z","title":"OPERA: Alleviating Hallucination in Multi- Modal Large Language Models via Over-Trust Penalty and Retrospection-Allocation","venue":null,"work_id":"b0169a0c-c36b-4fa9-8105-fa456e586b4f","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.415801Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:c0e5ac103fa13c2eb556db396f843a623ec870100957344ecac1a77812faaa29","observation_id":"c14090ae-40f0-470b-ab88-20f9de405246","resolution":{"observed_at":"2026-08-05T15:18:45.013860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11909","last_updated":"2024-11-22T03:34:15Z","snapshot_observed_at":"2026-08-06T09:35:42.681973Z","submitted_at":"2024-11-17T08:29:14Z","title":"SymDPO: Boosting In-Context Learning of Large Multimodal Models with Symbol Demonstration Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11909","snapshot_observed_at":"2026-08-05T15:18:34.487538Z","title":"SymDPO: Boosting In-Context Learning of Large Multimodal Models with Symbol Demonstration Direct Preference Optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.487538Z"},"links":{"cited_paper":"/paper/2411.11909","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:eff522a01593657d7af35e35d81e5ec838468bbd09a8b361f20bbad3d17ae7fd","observation_id":"5e7976ae-1078-4768-951f-4cc87b0400a0","resolution":{"observed_at":"2026-08-05T15:18:34.487538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15334","last_updated":"2025-06-06T02:50:17Z","snapshot_observed_at":"2026-07-06T19:36:36.994783Z","submitted_at":"2024-10-20T08:56:52Z","title":"Modality-Fair Preference Optimization for Trustworthy MLLM Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15334","snapshot_observed_at":"2026-08-05T15:18:34.573801Z","title":"Modality- Fair Preference Optimization for Trustworthy MLLM Alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.573801Z"},"links":{"cited_paper":"/paper/2410.15334","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:53901fbacc6fb53fbda278ade3877e1be3b0b2daca3418c4c1e0d5191dea33fc","observation_id":"e846edc9-7c40-4f77-b1ce-f3caa3706ea2","resolution":{"observed_at":"2026-08-05T15:18:34.573801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:44.764966Z","title":"Deep Visual-Semantic Alignments for Generating Image Descriptions","venue":null,"work_id":"7629a207-0af8-4e57-91a3-99ff32922638","year":2015},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.627243Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:e4171111dbac7d639012404c424bc9c6cd6aeb5b959d8e3db5e1f611de78f1ea","observation_id":"a42f421e-1b5d-415d-9ed2-ff3e785bc210","resolution":{"observed_at":"2026-08-05T15:18:44.831257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:44.614415Z","title":"A Diagram is Worth a Dozen Images","venue":null,"work_id":"97e7fcd7-1481-4786-a52c-93ece6fbadb0","year":2016},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.679487Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:4ac9dad4b237d2e0ab4557e6b91e7dc0859d70177fdc4bc552be21ce8fb36bf6","observation_id":"59680675-abe2-464c-94f4-a16dfb6e9bb0","resolution":{"observed_at":"2026-08-05T15:18:44.684805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:44.443430Z","title":"Adam: A Method for Stochastic Optimization","venue":null,"work_id":"53106dbd-0a7f-4a3c-ba4f-f6ed7e281bd0","year":2014},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.760053Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:444dd45839cb8f982cd521ae1b165b5c74f29962621aa7afc31d768e0dcb4aa9","observation_id":"5e912978-ee41-49a9-9984-22d5bd633da6","resolution":{"observed_at":"2026-08-05T15:18:44.544165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:44.281180Z","title":"Building and Better Understanding Vision-Language Models: Insights and Future Directions","venue":null,"work_id":"e1cb0a43-1600-4e8f-b290-cb3e643f2859","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.809548Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:6a7e1f696292f03ce49cc446f18e78373671f09e08ce72345288cbfbf946849d","observation_id":"1052199a-a17c-4420-88d2-7892d7a4e89e","resolution":{"observed_at":"2026-08-05T15:18:44.355978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:44.137162Z","title":"Mitigating Object Hallucinations in Large Vision-Language Models through Visual Contrastive Decoding","venue":null,"work_id":"3d58f6db-76bc-43cd-9e80-e1297d94584b","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.877521Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:d336011b62bd6ca1a9d5deeaa8898de36c508d58af99e77bb4c5c79d432dfda8","observation_id":"782f36dd-a6c6-4514-9b0e-130490a86fe2","resolution":{"observed_at":"2026-08-05T15:18:44.204406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-05T15:18:34.966231Z","title":"SEED- Bench: Benchmarking Multimodal LLMs with Generative Comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.966231Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:d10c186473fa18cf4eaf83d715079d4ef44578c833f860b7010197cbcd858066","observation_id":"40f8d7e9-5703-4601-bb7d-a57e3398ae68","resolution":{"observed_at":"2026-08-05T15:18:34.966231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:43.991065Z","title":"Microsoft COCO: Common Objects in Context","venue":null,"work_id":"e59dcd16-abfc-4d92-b4ed-812bf2814e2d","year":2014},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:34.986672Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:6ac5f3253481ece8043b65162cd83f7afb06e34288fd39e289f07f9334294f93","observation_id":"58dee9f8-daed-449c-9788-e2ce6244e4a2","resolution":{"observed_at":"2026-08-05T15:18:44.061394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:43.861531Z","title":"Visual Instruction Tuning","venue":null,"work_id":"09789d99-abc9-43ff-9d1a-e96850f8cf96","year":2023},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:35.104916Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:a3b89885633b0ccdab7c08ea5474d530e39779f701366ccdb0eb13db527aaef5","observation_id":"8a29cf57-fccb-4d96-804a-05a41d34fda5","resolution":{"observed_at":"2026-08-05T15:18:43.906662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:43.690925Z","title":"Improved Baselines with Visual Instruction Tuning","venue":null,"work_id":"b135fa63-15c7-41c5-b726-ad98985f3317","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:35.168310Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:295803c845c6389516d6d17f7d736d43ac88a2d2a3ebd958e65d7a7f3b6648fe","observation_id":"c781c242-1977-4ea8-9c01-e67a1ebf7b27","resolution":{"observed_at":"2026-08-05T15:18:43.781369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:43.482680Z","title":"Neural Baby Talk","venue":null,"work_id":"dd3cf16a-5cab-4e2c-b701-ae115b6f256d","year":2018},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:35.235925Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:26959e3158b8496d688ab455d710ba527869aba9c31e01a1266558e8b6121b2d","observation_id":"8f50a13a-764c-48c3-80ec-3fa938bc28b8","resolution":{"observed_at":"2026-08-05T15:18:43.575627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:43.367597Z","title":"Learn to Explain: Multimodal Reasoning via Thought Chains for Science Question Answering","venue":null,"work_id":"e81e1e25-9b62-4284-964b-e46e7caed832","year":2022},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:35.338300Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:eb5a2e627c746a88e3b3db6615cf4e2e6688e9cccbe2ece23f778ecec6444ef5","observation_id":"77d1b174-dcb7-4de3-9546-555040288061","resolution":{"observed_at":"2026-08-05T15:18:43.406314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:43.231818Z","title":"Revisiting Image Captioning Training Paradigm via Direct CLIP-based Optimization","venue":null,"work_id":"1e63bdff-a215-4924-903c-721d0a882695","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:35.418133Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:4048fc76269e952309ba77fc3dadc58086ff331f936391fa72b9d6c9765d7509","observation_id":"8dc5e733-1208-4222-ab15-4a45185e77ea","resolution":{"observed_at":"2026-08-05T15:18:43.299250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:43.018502Z","title":"Training Language Models to Follow Instructions with Human Feedback","venue":null,"work_id":"fc881477-da54-4724-9e63-7396f58adbef","year":2022},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:35.522414Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:0b54c2c4446452eb788c5d1dcd01773e4adbfeccb2e5406fb0d90c09a539ccd1","observation_id":"832d9554-25a1-458b-aafb-d7903e8b18df","resolution":{"observed_at":"2026-08-05T15:18:43.120956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18799","last_updated":"2024-09-09T16:00:04Z","snapshot_observed_at":"2026-08-07T23:02:57.475253Z","submitted_at":"2023-11-30T18:43:51Z","title":"X-InstructBLIP: A Framework for aligning X-Modal instruction-aware representations to LLMs and Emergent Cross-modal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18799","snapshot_observed_at":"2026-08-05T15:18:35.610779Z","title":"X-InstructBLIP: A Aramework for Aligning X-Modal Instruction-Aware Representations to LLMs and Emergent Cross-Modal Reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:35.610779Z"},"links":{"cited_paper":"/paper/2311.18799","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:1a7394489dca5ac84ec6a0c198e98b75b8fb130f44f1bc4967593d0ac6d618c6","observation_id":"bee4125a-b824-4a19-a701-e96c733a7aa2","resolution":{"observed_at":"2026-08-05T15:18:35.610779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-05T15:18:35.706620Z","title":"KOSMOS-2: Grounding Multimodal Large Language Models to the World","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:35.706620Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:12af7f12794f66e9be319e9c8f839cffe489da558f65319546c8fb9e6e09bf7c","observation_id":"9544c7ab-c9dc-49a6-a6ee-5bbee819651c","resolution":{"observed_at":"2026-08-05T15:18:35.706620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:42.835496Z","title":"ALOHa: A New Measure for Hallucination in Captioning Models","venue":null,"work_id":"8fd3e311-23d9-4a31-83c3-543a3420d414","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:35.805621Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:824f92f21093c588979931fb1b9f9da750e19f7cb4c3f2f6e4803f53bdeb8298","observation_id":"20eb7156-1f02-471e-9caf-07b94a86a2ec","resolution":{"observed_at":"2026-08-05T15:18:42.905433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:42.648458Z","title":"Learning Transferable Visual Models from Natural Language Supervision","venue":null,"work_id":"db6361b9-56d1-4da2-b2b7-8a643e5ddd53","year":2021},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:35.930386Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:f1332f941dd43bc9e3b2358367ba19686723f76e20c4113a1e722433d1937591","observation_id":"07fdf4d2-ab81-4fa0-b523-3151a51980cf","resolution":{"observed_at":"2026-08-05T15:18:42.755521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:42.466841Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","venue":null,"work_id":"8946df7a-3ee2-4cde-b1fd-310c912ac0c6","year":2023},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:36.047228Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:b50fb9cd9e226b7b3dec3954e11d4c630b1df47977edae6fa9d67383889d7e3b","observation_id":"843fec70-3497-42ef-b395-0745e3657dc9","resolution":{"observed_at":"2026-08-05T15:18:42.550010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:42.272496Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":"90e7c76d-3b72-4021-8331-be32b52fbc45","year":2020},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:36.126068Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:0534b51019c37ac9a1ee24a62be7285e17487a8f34b11a7944bd999f3c29ee7b","observation_id":"2ab81ef8-0b8d-4628-a278-a6ef25256dbf","resolution":{"observed_at":"2026-08-05T15:18:42.384739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:42.071909Z","title":null,"venue":null,"work_id":"2cb66c43-82e9-41a9-a767-8a45f4b57cf7","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:36.231373Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:8bda3ec6ab4711d711b23126e3abd58acd4d3659f84ca13ffe816fe03e5327a6","observation_id":"95965ad1-59e2-46e3-8621-f1a702492dc4","resolution":{"observed_at":"2026-08-05T15:18:42.192143Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:41.905492Z","title":"GLaMM: Pixel Grounding Large Multimodal Model","venue":null,"work_id":"f91b3a37-9ecc-4c4b-a5a7-e4c135f0b5fb","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:36.346112Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:2ca774ffde017256c0985d1adb70ba08f20f307d32a9db61a589f6e7cd9ef633","observation_id":"aeffee8b-6a26-47bc-a105-d830f14030d7","resolution":{"observed_at":"2026-08-05T15:18:41.986421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:41.663891Z","title":"Object Hallucination in Image Captioning","venue":null,"work_id":"b63d0d55-511f-40aa-acdd-bc2b550312e4","year":2018},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:36.415263Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:9d84c0088b9c14823f9353cf3eacfe4edf68ebe61cf1d8e1f5599be6b911fd02","observation_id":"f21c23fc-3b63-43d6-b3f3-1ab37cb59282","resolution":{"observed_at":"2026-08-05T15:18:41.766647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:41.433076Z","title":"A Comprehensive Survey of Hallucination in Large Language, Image, Video and Audio Foundation Models","venue":null,"work_id":"a6935a54-a1f5-4e08-ae31-3733f134fa85","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:36.509687Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:8b419b5628fdd955d22e9904244066d4b36ca1066227559fb9200d60ec025575","observation_id":"e2148b3b-839c-4bc9-b88e-1885fa84595a","resolution":{"observed_at":"2026-08-05T15:18:41.518595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:41.206538Z","title":"Mitigating Object Hallucination in MLLMs via Data-augmented Phrase-level Alignment","venue":null,"work_id":"9fd64267-f765-4feb-bdf3-25e551ab488c","year":2025},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:36.579679Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:74a5f9695a8797cbd3795254bce1e2ee21c7580ff9adf0b6895ab0556fd0c99f","observation_id":"18cd79d6-89c2-4614-9fd1-0edbf04ae8c5","resolution":{"observed_at":"2026-08-05T15:18:41.320547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:41.019073Z","title":"Image Captioning Evaluation in the Age of Multimodal LLMs: Challenges and Future Perspectives","venue":null,"work_id":"7a4d002e-4a3a-4ee4-b849-75b79deba72b","year":2025},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:36.705610Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:9099aa4ce065e8f23c71f2147a4fbfd8c3fd434caaa231629e8521d56b398676","observation_id":"2039ac83-8e54-4728-b8a7-577a9767572f","resolution":{"observed_at":"2026-08-05T15:18:41.081923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:40.762121Z","title":"Preference Ranking Optimization for Human Alignment","venue":null,"work_id":"c7189794-ae84-47c4-be0b-24a10cca4c56","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:36.810488Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:66ae74d19a6eed80bac0ce9415c5aebe553d76b7023ee751d7bb5f6d3ecdfa7f","observation_id":"cbd03fb7-f0da-4845-9c97-0303d3c985e1","resolution":{"observed_at":"2026-08-05T15:18:40.899088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:40.546164Z","title":"Generative Multimodal Models Are In-Context Learners","venue":null,"work_id":"6e60bbe9-7d09-4e5b-b433-6febd3290d0d","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:36.909666Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:f1bde0b49e86bfe67b153f20bffe0314b61462a1b4c6fd4f95bf05dd328b6246","observation_id":"1421c234-b11e-4b39-b548-1af87161d091","resolution":{"observed_at":"2026-08-05T15:18:40.659037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:40.255312Z","title":"Emu: Generative Pretraining in Multimodality","venue":null,"work_id":"a9d6da9a-46d8-4cd7-afa6-d16a337b7357","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:36.985220Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:e45451bf16b05b1f26c0969b9b13d1391bd9fec87099d10c653eda55d0f4e680","observation_id":"8bfa37b4-121b-4936-9a27-13d83b38e546","resolution":{"observed_at":"2026-08-05T15:18:40.408757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-07T22:11:30.869700Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-05T15:18:37.090202Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:37.090202Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:ed0878419f3252b717bce66aa419c485c77827eeac852f00bf41cffa81fe9e07","observation_id":"a9ea855e-2585-4e7c-b925-5d19ae5679d1","resolution":{"observed_at":"2026-08-05T15:18:37.090202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:40.053535Z","title":"Diffusion Model Alignment Using Direct Preference Optimization","venue":null,"work_id":"fd0e3d51-cdcf-4add-b5f2-b7b03fe41fc8","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:37.175875Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:8ffdf4b23566a672525e0f4ac899b625e9ce5a2aee4aaf876fe04a794b6de2f9","observation_id":"b496aa58-812d-4983-9b89-7980a5cfb16d","resolution":{"observed_at":"2026-08-05T15:18:40.143255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:39.868294Z","title":"mDPO: Conditional Preference Optimization for Multimodal Large Language Models","venue":null,"work_id":"5de222dc-9638-4227-9141-a0ee8432f6b6","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:37.237229Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:34da1a4d8b1f44ffe27628e2e1c29b15e75759edc3781bdc3953c816bf5f9bd5","observation_id":"542df41f-67b2-4837-b2cd-d153c98b5043","resolution":{"observed_at":"2026-08-05T15:18:39.954334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07397","last_updated":"2024-02-23T07:54:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-13T15:25:42Z","title":"AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07397","snapshot_observed_at":"2026-08-05T15:18:37.343758Z","title":"AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:37.343758Z"},"links":{"cited_paper":"/paper/2311.07397","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:0befb93a6df0fc39826ecb7a12f47f8c1d7383c9c81343dfc2695881f0cdff14","observation_id":"e47e4548-3d66-4c7c-812c-0ee946ed0445","resolution":{"observed_at":"2026-08-05T15:18:37.343758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:39.676215Z","title":"β-DPO: Direct Preference Optimization with Dynamic β","venue":null,"work_id":"35715d94-4be9-433d-94b1-e5df46bc7d7c","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:37.450314Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:37ca263a81c52c8dd0719a28d7f289f517f656a68b80e184328fa008815a9bea","observation_id":"763ebf0d-5362-40ed-bb2b-a54dc70e86a7","resolution":{"observed_at":"2026-08-05T15:18:39.747243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:37.545387Z","title":"Generate, but Verify: Reducing Hallucination in Vision-Language Models with Retrospective Resampling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:37.545387Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:897d58104c6e0f8f9db2902215dec41fbac5097092094e4655d2dc63e8cfb62a","observation_id":"71201094-c262-4c15-a072-894163de4499","resolution":{"observed_at":"2026-08-05T15:18:37.545387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11817","last_updated":"2025-02-13T08:11:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-22T10:26:14Z","title":"Hallucination is Inevitable: An Innate Limitation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11817","snapshot_observed_at":"2026-08-05T15:18:37.645387Z","title":"Hallucination is Inevitable: An Innate Limitation of Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:37.645387Z"},"links":{"cited_paper":"/paper/2401.11817","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:70e27ac7b6f1a086968f1539728416765ee6673b2f6e41d8a8708694608defc7","observation_id":"68748eee-39d8-4884-970b-7d04b4f7f28e","resolution":{"observed_at":"2026-08-05T15:18:37.645387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:39.462445Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","venue":null,"work_id":"04afc5de-67df-446e-b0d0-d1ccd6992694","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:37.730768Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:c70ecc0555b2e385cd9bc051d93e128d0d1264b3e5ad468070c2fc1f7f3311cd","observation_id":"da24e78b-5ea9-48d6-b792-84db0f1e00c9","resolution":{"observed_at":"2026-08-05T15:18:39.562614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:39.224553Z","title":"Woodpecker: Hallucination Correction for Multimodal Large Language Models","venue":null,"work_id":"a1bc17e4-e1b5-4d79-b70c-15bb46bb2dc0","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:37.868533Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:0c89b1c95a6de6b2ff91a03b13e34252a240e766aae27f869c3415c7e9298334","observation_id":"54aecb68-9571-4f58-aad0-03e267d4e7cb","resolution":{"observed_at":"2026-08-05T15:18:39.284926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:39.065832Z","title":"RLHF-V: Towards Trustworthy MLLMs via Behavior Alignment from Fine-grained Correctional Human Feedback","venue":null,"work_id":"4b255f06-49b3-495a-84b0-6deb36f9857a","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:37.961289Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:bb71ecc5f8e3e28109b1ddab54109f97cef8a5a4ae923958020c2f38a2d8e95b","observation_id":"59fcc504-01a8-47f3-ac35-cb77c76f39af","resolution":{"observed_at":"2026-08-05T15:18:39.157806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:38.869239Z","title":"MMMU: A Massive Multi- discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","venue":null,"work_id":"7fca4201-7a79-4445-b5f0-4af5ba05345f","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:38.030782Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:9a25df5b2e2f338db2c177ba3361e4fb9137428647195606a263ea69213018eb","observation_id":"313a7679-acee-4046-a3cd-d430e7fe5070","resolution":{"observed_at":"2026-08-05T15:18:38.972271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:38.677998Z","title":"Less is More: Mitigating Multimodal Hallucina- tion from an EOS Decision Perspective","venue":null,"work_id":"269f20dd-5506-4846-82e9-f54ef4500686","year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:38.089116Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:65735fd67cf5fd1a0ba0036634b89829fed7abcb547dd4912da31c132a06e0ba","observation_id":"546fe4ea-ce4f-4fe7-b9f4-1bd76adecadc","resolution":{"observed_at":"2026-08-05T15:18:38.798240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01258","last_updated":"2024-04-02T12:47:49Z","snapshot_observed_at":"2026-08-08T06:22:53.769876Z","submitted_at":"2024-04-01T17:28:16Z","title":"Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01258","snapshot_observed_at":"2026-08-05T15:18:38.154826Z","title":"Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:38.154826Z"},"links":{"cited_paper":"/paper/2404.01258","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:5fb3ddf93967cf9a5ce9066aa7d13bd0c686b40e064c40b5d2b445ec19acf58c","observation_id":"1661428f-ebf7-4c65-8919-adb87ceb1eb5","resolution":{"observed_at":"2026-08-05T15:18:38.154826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16839","last_updated":"2024-02-06T16:43:31Z","snapshot_observed_at":"2026-08-08T04:17:23.797697Z","submitted_at":"2023-11-28T14:54:37Z","title":"Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16839","snapshot_observed_at":"2026-08-05T15:18:38.238296Z","title":"Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:38.238296Z"},"links":{"cited_paper":"/paper/2311.16839","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:063757fb67972395581d1cb5c9af97567f49518e2e1c9b29cbdf9a4d5b855269","observation_id":"cd5e3884-6b94-458c-8444-5aad718bfc37","resolution":{"observed_at":"2026-08-05T15:18:38.238296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-08-05T15:18:38.304903Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:38.304903Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:192d41cd6b164e5b0eb76d221f95332b0741dcd874121be6d490fedeb62a6a04","observation_id":"434d2507-e21f-4685-9e3a-59f1de608687","resolution":{"observed_at":"2026-08-05T15:18:38.304903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:18:45.887931Z","title":null,"venue":null,"work_id":"84406e39-d47e-4193-a845-d2d79d2e65b4","year":2023},"citing_paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T15:18:33.768882Z"},"links":{"citing_paper":"/paper/2508.20181"},"observation_digest":"sha256:9bc2072d6f07a624854a5d460dbce85e76abd9a888ad2bc008aac24e7ea7c50b","observation_id":"58115e0f-2772-4f35-9bbf-efa8d4f24aa3","resolution":{"observed_at":"2026-08-05T15:18:45.992589Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.20181","last_updated":"2025-08-27T18:02:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T09:16:51.439526Z","submitted_at":"2025-08-27T18:02:04Z","title":"Mitigating Hallucinations in Multimodal LLMs via Object-aware Preference Optimization"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":42},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 1 inbound Pith citation observation for arXiv:2508.20181."}