{"as_of":"2026-08-06T19:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2028599fbbd7314c66d7276338de7f101a5941d91cf89d13c6ff08516b80d74e","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T01:25:41.549837Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.06679/citation-record","integrity":"/paper/2605.06679/integrity","json":"/paper/2605.06679/citation-record.json","paper":"/paper/2605.06679"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mitigating object hallucinations in large vision- language models with assembly of global and local attention","venue":null,"work_id":"0b99923f-6484-453b-b74e-738f1221180f","year":2025},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:4f87592d651830a809543d1eec1738c25933b91931434eb41b9e703fe9812566","observation_id":"13d73112-c3f3-4010-aace-2c7ee87477a2","resolution":{"observed_at":"2026-05-14T16:27:10.156865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":"b67f9d3e-e4b8-4fc9-b3ec-fdd0518a24d0","year":2023},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:5ed7a4c525c333d31fdf6657c897cbf47571837ca8d2278d9ed24fa7545ce367","observation_id":"c61b65fb-6ee2-4e1a-b634-2600e0bfb056","resolution":{"observed_at":"2026-05-14T16:27:10.143220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hallucination of multimodal large language models: A survey.arXiv e-prints, pages arXiv–2404","venue":null,"work_id":"c793e925-09ba-4997-a99f-6f6dabe466ac","year":2024},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:9648a2ae00c05124afb58360f1d26891a38f6fd3f14467c750ef302d5da928ef","observation_id":"8cef9147-36e2-460a-aff0-2136a6912504","resolution":{"observed_at":"2026-05-14T16:27:10.158570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Comment: Microarrays, empirical bayes and the two-group model.Statist","venue":null,"work_id":"7e31e4a3-d9d5-4160-a661-7e5d127dac92","year":2008},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:c65775625425706567914c7e027e8b3f9fbfdd421685fbfab5b6eafec9b965be","observation_id":"486e7857-849f-4f42-babc-626ce1c1a52b","resolution":{"observed_at":"2026-05-14T16:27:10.154706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-object hallucination in vision language mod- els.Advances in Neural Information Processing Systems, 37:44393–44418","venue":null,"work_id":"c275d967-f6dc-416d-9994-178f772ac347","year":2024},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:771705162ad87405b9ee785fc925a787ae36f7e624a06600315255cabe6869a4","observation_id":"36031364-3d28-4cf9-9a92-b5b3cfd93752","resolution":{"observed_at":"2026-05-14T16:27:10.147418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On some recent advances on high dimensional bayesian statistics.ESAIM: Proceedings and Surveys, 51:293–319","venue":null,"work_id":"63289d61-c667-4e1f-8c3d-c007ea3e4d07","year":2015},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:47dd57acc3ce2a866d39e51a7e9227bcfa48aa1dc6307fdbc0b4b50fc69eafc7","observation_id":"cb69d350-3339-492d-9927-4d9eddaa3b9a","resolution":{"observed_at":"2026-05-14T16:27:10.152935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instructblip: Towards general-purpose vision- language models with instruction tuning.Advances in neural information processing systems, 36:49250–49267","venue":null,"work_id":"84a96cd8-c3f3-4345-a467-1e992d1d24a5","year":2023},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:d20680f9a9a256ba06b025c3613de498f85ea7c3c11d2cc76d3f08e939564659","observation_id":"0b8508ec-9deb-4897-b166-6515b048b61c","resolution":{"observed_at":"2026-05-14T16:27:10.151185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Plug and play language models: A simple approach to controlled text generation","venue":null,"work_id":"3378a68e-9e31-4965-8049-4bff60b42b54","year":2020},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:80b1b15bacb3c3e8778bc8ce4b1efd5645c9766b34ca083f2788744d509a0c6e","observation_id":"511720ac-f315-418a-8ccf-375c47c4f5f0","resolution":{"observed_at":"2026-05-14T16:27:10.145441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"24192c4b-1b5c-409f-9611-5d5b83d32b74","year":2020},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:f8bb032a26c196082f3b364bae7cdb1946b4facd721ce540814d199cc5bf138c","observation_id":"03cb62ca-5535-44b6-bf40-22801f41b3a4","resolution":{"observed_at":"2026-05-14T16:27:10.160411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hallusionbench: an advanced diagnos- tic suite for entangled language hallucination and visual il- lusion in large vision-language models","venue":null,"work_id":"fe7420f8-4aee-4084-bb28-b85f41017efe","year":2024},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:a1e1c1f64a12f186f16af10993f954b6a2121a7ca3175620a0dafa73f1d1595e","observation_id":"cf9d2928-196a-48b4-9f6a-a768818c6602","resolution":{"observed_at":"2026-05-14T16:27:10.081711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Detecting and preventing hallucinations in large vision language models","venue":null,"work_id":"8582bf2a-e735-41d2-9333-90cda9c9e50e","year":2024},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:a9e782fe59f52c38ea46ffa3713df5fc64d4e4000664e19d8e894f2835c8e737","observation_id":"022a5088-8b22-4b50-8791-74f9048968c7","resolution":{"observed_at":"2026-05-14T16:27:10.123981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising dif- fusion probabilistic models.Advances in neural information processing systems, 33:6840–6851","venue":null,"work_id":"037f8f5d-d077-4875-8d3b-6c6bfe022c97","year":2020},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:9c72fb2530e6811e26c97513ecb97faf39f3bef62c8ccf9ed4b337c42fa08d26","observation_id":"fcb38fb8-5e54-4682-bb8e-d12298cad749","resolution":{"observed_at":"2026-05-14T16:27:10.125734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bliva: A simple multimodal llm for better handling of text-rich visual questions","venue":null,"work_id":"a0aca9dd-3163-489e-8e27-7db2b71b7a9c","year":2024},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:04ea730bd0cdad11dfc8ee4cb990f527e5a041654089b639c8de1be9823a09ac","observation_id":"0d1d5b66-7dde-4186-bde0-95a5454abf47","resolution":{"observed_at":"2026-05-14T16:27:10.133369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on hal- lucination in large language models: Principles, taxonomy, challenges, and open questions.ACM Transactions on Infor- mation Systems, 43(2):1–55","venue":null,"work_id":"51303a27-c452-4c72-a570-d860f8d3f7c4","year":2025},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:d13ff31ced2012ec39ca8a79b70c5fa5eb7bb1e416de649cefa3e1db5abdb7e0","observation_id":"e1e989a4-c650-47db-af57-9e7ce46c5b37","resolution":{"observed_at":"2026-05-14T16:27:10.141489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Opera: Alleviating hallucination in multi- modal large language models via over-trust penalty and retrospection-allocation","venue":null,"work_id":"6c22b78f-e768-4b74-90cf-77b79f106ff1","year":2024},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:4a6290b69a4b5910c5e3f97cdd605b8111fb3f00ecce9d73445fa28f5eda4375","observation_id":"d5a6008d-83c8-425d-9407-13ac26982e0d","resolution":{"observed_at":"2026-05-14T16:27:10.127873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"0752e0e0-be2e-4607-99a9-998cca9d92e1","year":2019},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:56153afd3abd8838a71e341052b2b496b10b706f284f9bd4a997bff068331680","observation_id":"a7d014e3-aa3e-4948-9d3f-e08f224ed4ea","resolution":{"observed_at":"2026-05-14T16:27:10.116061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16922","last_updated":"2023-11-28T16:26:35Z","snapshot_observed_at":"2026-08-06T11:52:36.686824Z","submitted_at":"2023-11-28T16:26:35Z","title":"Mitigating Object Hallucinations in Large Vision-Language Models through Visual Contrastive Decoding","version":1},"cited_work":{"arxiv_id":"2311.16922","doi":"10.48550/arxiv.2311.16922","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.16922","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mitigating Object Hallucinations in Large Vision - Language Models through Visual Contrastive Decoding , November 2023","venue":"arXiv (Cornell University)","work_id":"2419676a-300e-493a-ae8a-406e0e4dd42c","year":2024},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"cited_paper":"/paper/2311.16922","citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:86c3cc4b974420b6e303f9daffef16813eb7bd942ff6f57ab0d5d35e33ebd74d","observation_id":"9a73a940-a5c4-4d95-be9c-81bef7b6b098","resolution":{"observed_at":"2026-05-11T04:25:57.216356Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:08.188725+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:08.188725+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:54:34.281459Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"7be08f75-0358-4494-bd51-c16d3077a074","year":2022},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:409da87b5e16a8818c5a802057adc7570825b5dcdd58fde0c513e0ab1a87253f","observation_id":"a7b5e0ad-a670-4609-8ea7-2143d2e3c0e6","resolution":{"observed_at":"2026-05-14T16:27:10.113703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Streamlining prediction in bayesian deep learning","venue":null,"work_id":"3a3fa982-1da1-45fc-b92b-63f2cca39644","year":null},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:f7e1e844ca33563b884985dbe6d91b7c5c3918a0cea36087d4aff3feb7b604f2","observation_id":"d7dccb8d-9d71-4b01-bdf4-fda17d7be417","resolution":{"observed_at":"2026-05-14T16:27:10.117978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"33295fe2-7e71-4978-ac17-b09b220f5e0e","year":2023},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:1c12cc39ca0384254aafe1c11c1fa1b9672572f47fe76df83fe886227d79800e","observation_id":"6bffd226-0cfa-4a30-9064-924f0027157e","resolution":{"observed_at":"2026-05-14T16:27:10.120155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A multi-label detection deep learning model with attention-guided image enhancement for retinal images","venue":null,"work_id":"596c2477-71b5-4f42-8069-85f344092542","year":2023},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:3d4c755f6f8ef4f28df84e3c35267ad2088519c5b4fb88c6ed0317aa45ee9a16","observation_id":"3f09176a-4c26-433c-b393-4284aca93ae6","resolution":{"observed_at":"2026-05-14T16:27:10.108056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mind the gap: Understanding the modality gap in multi-modal contrastive representation learning.Advances in Neural Information Processing Sys- tems, 35:17612–17625","venue":null,"work_id":"8f973e24-e5db-4e3b-a554-e33bc5e47572","year":2022},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:62a33bc3eeabce98601bd43fd92693b71300b8b73be787ebb8f78223a754d452","observation_id":"3cddec10-1d66-4d1f-8380-9d2b7c37b436","resolution":{"observed_at":"2026-05-14T16:27:10.109998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:14:35.654344Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"bbde3644-0add-4fa3-880b-2bf7798d74a0","year":2014},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:79e56adc8a841bdf9df74548ecbd02d53844f6b1a5a039a851a31f5c9d18da45","observation_id":"469427e4-c2f6-4c34-93a7-27769c9406e9","resolution":{"observed_at":"2026-05-14T16:27:10.149155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:53:32.175571Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916","venue":null,"work_id":"a778ff6a-f7fb-434e-bacd-489db651bc50","year":2023},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:9d71f5a5d8c177045d3830e80c090d540103cb94e65f00a4474f9cb9db0c6b87","observation_id":"8c15b58c-5e57-45ba-97af-ac4b1f70934e","resolution":{"observed_at":"2026-05-14T16:27:10.104038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"35957b33-c441-4220-be1c-6f417d7ac940","year":2024},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:bba512bc42820e0945a198e313213dc08dea7e7ecd4a36432ea1f347780708df","observation_id":"4628cd45-a0c4-4092-9630-309c5ed4c7c7","resolution":{"observed_at":"2026-05-14T16:27:10.129923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reducing hallucina- tions in large vision-language models via latent space steer- ing","venue":null,"work_id":"6edc4537-dca8-45ae-b54f-48c438310b16","year":2025},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:88d4c405940ec9ed2ba73b640475431538a0415c79647496a57f60f7e96a60ec","observation_id":"b093f4ba-be1d-4cb0-8575-5f3ec8abd24e","resolution":{"observed_at":"2026-05-14T16:27:10.131684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":"2403.05525","doi":"10.48550/arxiv.2403.05525","metadata_source":"pith","pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","venue":"cs.AI","work_id":"30da36a4-b9ad-4618-8955-c09232b61343","year":2024},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:aef262920a6a9aa229d20fc9c970ba7d51ad610fc32026252f2c535202da9475","observation_id":"2846ad89-5da2-41ab-8d90-dca5fc542d7c","resolution":{"observed_at":"2026-05-11T17:58:54.896552Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training language models to follow instructions with human feedback.Ad- vances in neural information processing systems, 35:27730– 27744","venue":null,"work_id":"f6ca8f3f-0f7e-4843-a396-fb8099b36a1c","year":2022},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:abe426240a19c6f761f594ca2b35f8dd11c7ec7c34edd5f7377419d34d02c635","observation_id":"8365878f-dc31-4b92-9d51-4baaaa51e2dd","resolution":{"observed_at":"2026-05-14T16:27:10.101776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Event co-occurrences for prompt- based generative event argument extraction.Scientific Re- ports, 14(1):31377","venue":null,"work_id":"a88eac6e-247c-4740-9469-ad9b404c5ac6","year":2024},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:ab195591e4b0eef4bfd4598507183c94c0c4a5818b0e281e505575c317c83f48","observation_id":"89bf3289-1d2a-4572-8d0e-a7b8923e21e2","resolution":{"observed_at":"2026-05-14T16:27:10.106194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep multi-scale at- tentional features for medical image segmentation.Applied Soft Computing, 109:107445","venue":null,"work_id":"dd2e2aa0-98be-4f78-8565-949a226791ee","year":2021},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:f5c03a4cb22f2485386d1cbe44a9a5711c29d6932bd4867bb35dfebc95020243","observation_id":"28d241a8-f170-42d0-a47d-dbbdde2e0ad7","resolution":{"observed_at":"2026-05-14T16:27:10.111863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Object hallucination in image cap- tioning","venue":null,"work_id":"a74d1d03-9b97-498f-967a-8983feb32227","year":2018},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:b50f1f4ba3ba71d4a40aaffe50fccfef6129e77bada1944a22fec401e631f178","observation_id":"7ccaa4ae-1b0d-4250-bb77-b51b248bbf18","resolution":{"observed_at":"2026-05-14T16:27:10.122226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A-okvqa: A benchmark for visual question answering using world knowl- edge","venue":null,"work_id":"d848cb61-6c07-4ead-ae46-b28ca7127ab8","year":2022},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:762164aebfcbd8e8745fb9631bc0fb82cdd76f3f2f9c892e1e704e0936a6e208","observation_id":"839af132-3938-4a8a-a4d3-f126457cf2aa","resolution":{"observed_at":"2026-05-14T16:27:10.099045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards understanding the modality gap in clip","venue":null,"work_id":"c136590a-b5fe-4b2b-8517-eff6ac11c9e8","year":2023},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:51e375ae02b3e1664fb86b6cc3944a54ac405b851ac63d2b8aab54872db713df","observation_id":"88ac5db4-53fb-499b-ad6d-7616dbead18d","resolution":{"observed_at":"2026-05-14T16:27:10.097321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.01346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T20:27:22.585602Z","title":"Large vision-language model alignment and misalignment: A survey through the lens of explainability","venue":null,"work_id":"eb9e4e70-8839-4a58-b512-97f072f5d676","year":2025},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:779b10e214c1255d5b90111c78d8540bf244e00dcb10151ce964445c6a3a9a14","observation_id":"f3fc0198-8a95-4b69-b579-0257051b3678","resolution":{"observed_at":"2026-05-11T04:25:57.164203Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention-guided sample-based feature enhance- ment network for crowded pedestrian detection using vision sensors.Sensors, 24(19):6350","venue":null,"work_id":"2ad14835-750f-437c-b606-1f48cd6b4f56","year":2024},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:1a25f1d08621722bae50aa38ed6adbdc99893703b6b6f0782faf9c6126a09240","observation_id":"44969771-3c45-47dd-90bb-76816de3e6c4","resolution":{"observed_at":"2026-05-14T16:27:10.093636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:48709052a14aa32b380848c9db5b7c7f34da9652071e8e87c859ec0da78ef128","observation_id":"70146606-dbf8-4ddc-9251-ff536b6b6a2a","resolution":{"observed_at":"2026-05-11T04:25:57.193343Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":"2411.10442","doi":"10.48550/arxiv.2411.10442","metadata_source":"pith","pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","venue":"cs.CL","work_id":"52f12dd6-1165-4717-9a1b-04ff19d82dfe","year":2024},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:ce5ca5235847499334880f842ec4c8b2f1db28b5a753f8be7a1d65b6830056b5","observation_id":"0174c04b-d95f-41dc-96e7-50fcf3e0380f","resolution":{"observed_at":"2026-05-16T09:16:17.933281Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recent advances in algebraic geometry and bayesian statistics.Information Geometry, 7(Suppl 1): 187–209","venue":null,"work_id":"059de4cb-65a4-46fd-8abd-16ae409fece2","year":2024},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:4327a619a224fff4ad9fdd410f23767cb86885f4557592e71e019a8a35ec3329","observation_id":"04c16c70-22f9-4808-8548-3cf7589b2c80","resolution":{"observed_at":"2026-05-14T16:27:10.095591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen3 technical report","venue":null,"work_id":"1f2e4e29-0e44-42a0-98e2-ee43a32a4498","year":2025},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:bb2216c702faa9e49448391f8d2cc59932e3febab1904c3e7c831c8a4ae4478f","observation_id":"5320d2df-235e-4d8f-9fe4-66fa38d79037","resolution":{"observed_at":"2026-05-14T16:27:10.089115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mitigat- ing hallucination in large vision-language models via mod- ular attribution and intervention","venue":null,"work_id":"2b97f4bf-b07e-497e-859d-bbbd1c9ba140","year":2025},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:25d2e91b44b80b6afc65e20038e926d6f31a64492f196be62a18af0b9788f329","observation_id":"02d29f06-bccf-4ed4-a2bb-b7058c15300c","resolution":{"observed_at":"2026-05-14T16:27:10.091371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clearsight: Vi- sual signal enhancement for object hallucination mitigation in multimodal large language models","venue":null,"work_id":"56ffe376-29c6-440e-9eca-3531379210ef","year":2025},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:129377e3ff696d124174737ece5d68e52e5745d4463b0d51b811b7389cc3a9e8","observation_id":"e07d7dcb-118b-4d30-ab46-25e0c6c6b071","resolution":{"observed_at":"2026-05-14T16:27:10.135341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on multimodal large language models.National Science Review, 11(12): nwae403","venue":null,"work_id":"e021e6fb-70ad-40bb-b931-aec8f2ba5fbf","year":2024},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:6d7b88d1a5ee3416211778e7b3604231cde8f83ea5fb030978d544da48c42dd7","observation_id":"39e2e36c-9224-45b3-a412-a3200eccb4b8","resolution":{"observed_at":"2026-05-14T16:27:10.137137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision-language models for vision tasks: A survey.IEEE transactions on pattern analysis and machine intelligence, 46(8):5625–5644","venue":null,"work_id":"43bc8649-cf5c-494f-b2ec-bdbc423d56a0","year":2024},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:212d8d06eed9e353da9b92d2d7aaac5ecedb4ef0e819fe2cde4f9cd8c0463dd1","observation_id":"1c625fd3-8c36-422f-bba4-c8e940004b09","resolution":{"observed_at":"2026-05-14T16:27:10.087465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Investigating and mitigating the multimodal halluci- nation snowballing in large vision-language models","venue":null,"work_id":"28c048e7-5424-49fc-8e5d-bf62aa9ca71e","year":2024},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:2513f5c89993fe18bde33aabb7d57a27bd010c6a59de8d980521e027a54d7eab","observation_id":"540c2ac4-70e7-4724-9f82-e34a24076fae","resolution":{"observed_at":"2026-05-14T16:27:10.083653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T06:03:21.503148Z","title":"Learning to prompt for vision-language models.In- ternational Journal of Computer Vision, 130(9):2337–2348","venue":null,"work_id":"250f6adf-5f0c-43cb-864d-176ca2c2482f","year":null},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:89e1ae104f8f95203d9faec4986bdf6a238808313bef2423a602f6e9e87627e1","observation_id":"db768e95-0a88-4d9a-90a2-32a3346fe838","resolution":{"observed_at":"2026-05-14T16:27:10.139634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ibd: Alleviating hallucinations in large vision- language models via image-biased decoding","venue":null,"work_id":"8315b918-ea23-4081-927f-9c9e355b741a","year":2025},"citing_paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:41.549837Z"},"links":{"citing_paper":"/paper/2605.06679"},"observation_digest":"sha256:5eef30cd021a7fa8d7be6b5f20efaebe552ba9374c353384ca40d25586597452","observation_id":"82d6c7c5-6efd-4a07-bffa-02f5c0ae0c43","resolution":{"observed_at":"2026-05-14T16:27:10.085522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.06679","last_updated":"2026-04-22T15:11:41Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-04-22T15:11:41Z","title":"Breaking the Illusion: When Positive Meets Negative in Multimodal Decoding"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":5,"verified_fuzzy":41},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2605.06679."}