{"as_of":"2026-08-05T17:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:756ff2ba049341c7d4201207c0baf994753c45d2b0df315e7ff1a1eb1c5f4c9f","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T23:32:11.613357Z","state":"measured"},{"denominator":84,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":84,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23944/citation-record","integrity":"/paper/2607.23944/integrity","json":"/paper/2607.23944/citation-record.json","paper":"/paper/2607.23944"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/0010-0285(77)90012-3","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"1977 , issn =","venue":"Cognitive Psychology","work_id":"ce0d9bd2-4348-4505-8edf-c1807d1dc86d","year":1977},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:05.685999Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:d3988162a6057742e2f8cd7da91eeaa81cc93c7ca436611667042e423ccd96d5","observation_id":"c7b381be-d5a8-4a81-920c-f094bcb493ff","resolution":{"observed_at":"2026-07-31T23:35:56.571285Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:05.739874Z","title":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing , year =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:05.739874Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:d81e51e40250b4580a7f713dd58493f7ceef41e8fc94d4835457a0c3a8f5756f","observation_id":"9e806867-8b79-49c2-b37b-6953db7c8e95","resolution":{"observed_at":"2026-07-31T23:32:05.739874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:05.824045Z","title":"Microsoft","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:05.824045Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:8773e9ad86a7958cf0d9e7868ae0b674945f1672434a69b8d0a5ef7f84214c37","observation_id":"ad84150b-3bb9-4ea9-a6fe-bd2d76f70726","resolution":{"observed_at":"2026-07-31T23:32:05.824045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:05.886909Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:05.886909Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:09622b899c46e8f421ed9c3e62f909ca970715a86ede458cc8b9bc7e16001407","observation_id":"326190c5-6d45-4bd6-9e33-5adbbaa91aa6","resolution":{"observed_at":"2026-07-31T23:32:05.886909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:05.939231Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:05.939231Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:ea4c81dd2d2752ef4aaf97a7e127d4c51d47c6b18d76c83bb6dd5bdcac75f60f","observation_id":"97a05ad9-8b50-478a-9475-ce3bbc9b5943","resolution":{"observed_at":"2026-07-31T23:32:05.939231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-31T23:32:06.024577Z","title":"arXiv preprint arXiv:2306.13394 , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:06.024577Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:0a3564dbce2bd625212679da7588f668157db79827bdc64ee4d9ae523f390e42","observation_id":"33ea0217-379f-4147-875b-f8e70ad5b358","resolution":{"observed_at":"2026-07-31T23:32:06.024577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:06.091141Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:06.091141Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:a522ab7bb8f64bdd2fcd0f48813a9fb1d31d14e5cbb800e29bee9b40e73f5038","observation_id":"7440f9cc-1115-4b34-bbd5-916208cf19f0","resolution":{"observed_at":"2026-07-31T23:32:06.091141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-07-31T23:32:06.160413Z","title":"arXiv preprint arXiv:2308.12966 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:06.160413Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:e62f64b7c05e71960c5aa794fdc3fbbd19f25b40aac6c8d77976075c90b4e877","observation_id":"898d1147-8ac1-4e8c-88af-f492eb1c3531","resolution":{"observed_at":"2026-07-31T23:32:06.160413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:06.229579Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:06.229579Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:9a038722a42fc91cf612d431fbac438fde442cdef3570133aefabaeea0f8adb3","observation_id":"c52e9d00-9238-45d4-8c01-8bd9aea9d789","resolution":{"observed_at":"2026-07-31T23:32:06.229579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:06.303756Z","title":"Computer Vision and Image Understanding , volume=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:06.303756Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:1a4150257ee8361de7e5895f0e4699cc27dc0874ef394b1d30bc034ee248f289","observation_id":"f27faba6-5234-4ecf-90f1-491055183c80","resolution":{"observed_at":"2026-07-31T23:32:06.303756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:06.380626Z","title":"arXiv preprint arXiv:2502.01969 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:06.380626Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:85282b059ed3dfd2e1e175799b7ff377401cb0fbf2e0175f89eaebf276789ac1","observation_id":"b7751eae-ae10-4359-9e3c-15e77b265800","resolution":{"observed_at":"2026-07-31T23:32:06.380626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21472","last_updated":"2025-08-11T19:24:13Z","snapshot_observed_at":"2026-07-06T21:31:35.572708Z","submitted_at":"2025-05-27T17:45:21Z","title":"Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21472","snapshot_observed_at":"2026-07-31T23:32:06.422905Z","title":"arXiv preprint arXiv:2505.21472 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:06.422905Z"},"links":{"cited_paper":"/paper/2505.21472","citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:268abb67d4f0583035523f6c8f518d8cd6093cda17b5a954c978bde75b6f2d59","observation_id":"e864b755-5c06-4cb5-9da5-8436f0261c45","resolution":{"observed_at":"2026-07-31T23:32:06.422905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-07-06T15:46:40.281717Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-07-31T23:32:06.470622Z","title":"arXiv preprint arXiv:2306.14565 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:06.470622Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:531e2953d652ab31893c6c85a48f33913b3d22a61f6752fcdc2ffea50354f798","observation_id":"c9a7d106-8815-4691-8a80-3db52107b8ce","resolution":{"observed_at":"2026-07-31T23:32:06.470622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:06.534464Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:06.534464Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:162d9d9a608ce102a57f7942c8b1830a768e4af10a22fe8105321af1f99d14ad","observation_id":"c51cba08-004c-4f2f-96fd-644e8d831bc8","resolution":{"observed_at":"2026-07-31T23:32:06.534464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:06.625961Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:06.625961Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:f55146321b90d35e4300d9fd038880a296e73ed91e2da549af8f62e9b8650c74","observation_id":"9718adf9-b69c-4c73-8c6c-04c32a9acb17","resolution":{"observed_at":"2026-07-31T23:32:06.625961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-07-06T20:16:48.980017Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02699","snapshot_observed_at":"2026-07-31T23:32:06.683252Z","title":"arXiv preprint arXiv:2501.02699 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:06.683252Z"},"links":{"cited_paper":"/paper/2501.02699","citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:a44c4989431f2ee1e2d855fa3ec904003dd6f12d852b85af69b3b03351c24a55","observation_id":"7e809645-c5ef-4a63-bc2b-21e91d2d3166","resolution":{"observed_at":"2026-07-31T23:32:06.683252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:06.756714Z","title":"Looking Beyond Text: Reducing Language Bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:06.756714Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:46edba48b9496c6f275a6f806c3b961e1f5b8bdcc59efe9f41b09ae938bd9b17","observation_id":"dfdaad2b-848d-4f5a-a2d8-94eefbd6119a","resolution":{"observed_at":"2026-07-31T23:32:06.756714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.09741","last_updated":"2026-04-20T07:40:50Z","snapshot_observed_at":"2026-07-06T22:32:22.953630Z","submitted_at":"2025-10-10T17:57:06Z","title":"Constructive Distortion: Improving MLLMs with Attention-Guided Image Warping","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.09741","snapshot_observed_at":"2026-07-31T23:32:06.823419Z","title":"arXiv preprint arXiv:2510.09741 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:06.823419Z"},"links":{"cited_paper":"/paper/2510.09741","citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:385f67cd29890d538884b25b2ce2a05fac40f9ad146b45757b410efc523c1a6a","observation_id":"ed981d59-8da8-4d89-9993-777545d84143","resolution":{"observed_at":"2026-07-31T23:32:06.823419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:06.892390Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:06.892390Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:8e6b0e51e876ae3e71ec861f78f6deedef4624297fa29b7460606ad1ad2458ad","observation_id":"d6cc6532-e320-439d-907f-1c958f6c8f23","resolution":{"observed_at":"2026-07-31T23:32:06.892390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:06.971374Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:06.971374Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:b77f8ed69003e570537d92b798d5060398bf3b9ef03937b7014bfe98efb6e541","observation_id":"a1322671-dc86-430a-ba41-f615504396ea","resolution":{"observed_at":"2026-07-31T23:32:06.971374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:07.041812Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:07.041812Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:8044f2fbe346a7a3d4e5d9034d6267b2ef3a17f2a61a1cf463f86e57f67f56c4","observation_id":"abe793e8-2fa8-4932-9d37-6a37eefcf706","resolution":{"observed_at":"2026-07-31T23:32:07.041812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:07.101476Z","title":"Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:07.101476Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:d965e9cb263203cf0e6519d5c139345fd4096fc588b52cd5823ae5f3b18a53b5","observation_id":"f36975e9-e991-4fc8-b745-a4af2b0cb68b","resolution":{"observed_at":"2026-07-31T23:32:07.101476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:07.165448Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:07.165448Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:b23194d76c76a6570e731c5a98c0f672b80dd683c7ebb0ba18ab545e50d8765b","observation_id":"871bc934-c6b6-478f-98b4-e5c4b801db60","resolution":{"observed_at":"2026-07-31T23:32:07.165448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17811","last_updated":"2024-06-05T11:15:04Z","snapshot_observed_at":"2026-07-06T17:36:27.931373Z","submitted_at":"2024-02-27T14:45:04Z","title":"TruthX: Alleviating Hallucinations by Editing Large Language Models in Truthful Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17811","snapshot_observed_at":"2026-07-31T23:32:07.261809Z","title":"arXiv preprint arXiv:2402.17811 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:07.261809Z"},"links":{"cited_paper":"/paper/2402.17811","citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:685bb059743767fe17b4a2a4928f01f59dc16ae80bba904cd13d4f8faf08b7cc","observation_id":"40bb3e52-2e6e-4ec1-ab5b-ba03877b1e90","resolution":{"observed_at":"2026-07-31T23:32:07.261809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:07.356674Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:07.356674Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:b3da179da4a723b2c08a64e9094a9428e788dead22ffb80ea6ee750350727b3c","observation_id":"593cc9ca-2b2e-4dad-9f6e-96501459e217","resolution":{"observed_at":"2026-07-31T23:32:07.356674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:07.407981Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:07.407981Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:e711eaa88fb2a719d2275ae640c4d35d3f8aceaf829fbbc726442e16d139d993","observation_id":"35cf5872-5d3a-4a4c-8524-bf07abc0a9c3","resolution":{"observed_at":"2026-07-31T23:32:07.407981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11613","last_updated":"2024-05-21T04:52:32Z","snapshot_observed_at":"2026-07-06T18:16:24.847459Z","submitted_at":"2024-05-19T17:08:31Z","title":"Decoding by Contrasting Knowledge: Enhancing LLMs' Confidence on Edited Facts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11613","snapshot_observed_at":"2026-07-31T23:32:07.483257Z","title":"arXiv preprint arXiv:2405.11613 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:07.483257Z"},"links":{"cited_paper":"/paper/2405.11613","citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:80ff9db390aa4e8ea26765c7bcbd56baa38f4b43fcf0bd41ce3ac98afa5b9834","observation_id":"51f42236-7ebd-4b0c-a957-2b0aa49de572","resolution":{"observed_at":"2026-07-31T23:32:07.483257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:07.583613Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:07.583613Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:2bf1ce3502c40824a208f191e5f1beb72fcaff4bec74a3e58c8935cf46d1a094","observation_id":"cdbec8e9-2af1-4568-8127-93d5b608a741","resolution":{"observed_at":"2026-07-31T23:32:07.583613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:07.643831Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:07.643831Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:178bc59c0c710848e458d7f1755e9c4540b6a23c42d64c9c0b492f016b0b2f12","observation_id":"8990250e-3f6d-41e1-9d55-10ce9555eea7","resolution":{"observed_at":"2026-07-31T23:32:07.643831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:07.696801Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:07.696801Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:cca87b2288bd63059740b1dcb6f95acf7d0d0afed93a124ab1172a922b8881fd","observation_id":"bf28a160-de11-429b-9c45-8858d9e06e82","resolution":{"observed_at":"2026-07-31T23:32:07.696801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-07-31T23:32:07.756950Z","title":"arXiv preprint arXiv:2306.14824 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:07.756950Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:167f5c935072580a29d83707c5f707fdbc22b1822a40291f8e4b6324d332f86c","observation_id":"b9e7fcbe-938e-4de5-85fe-811c07aeb18d","resolution":{"observed_at":"2026-07-31T23:32:07.756950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:07.833934Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:07.833934Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:877f7441a626207432e9935abcadf0b4f14abc48e5fde72550d3c71ae0d740cd","observation_id":"721eb36f-bb64-4b11-9018-f54e208c98d5","resolution":{"observed_at":"2026-07-31T23:32:07.833934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:07.896061Z","title":"Findings of the Association for Computational Linguistics: ACL 2025 , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:07.896061Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:beead21cca387e0f78ca36adff1daab64c7cbde56cad86045727c3b6cad330b7","observation_id":"19d9e412-0871-4590-875e-127ebbbde9a5","resolution":{"observed_at":"2026-07-31T23:32:07.896061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17061","last_updated":"2025-06-10T05:05:02Z","snapshot_observed_at":"2026-07-06T21:28:48.206779Z","submitted_at":"2025-05-17T09:44:18Z","title":"Mixture of Decoding: An Attention-Inspired Adaptive Decoding Strategy to Mitigate Hallucinations in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17061","snapshot_observed_at":"2026-07-31T23:32:07.965796Z","title":"arXiv preprint arXiv:2505.17061 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:07.965796Z"},"links":{"cited_paper":"/paper/2505.17061","citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:44f6ad2cff2ed68639719900d1cf16427a280ba80af2dbf915ee9e5f39ad7cb3","observation_id":"67c0c5ae-82ce-4ae8-9235-3e6ee1f57a39","resolution":{"observed_at":"2026-07-31T23:32:07.965796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15055","last_updated":"2024-10-23T13:20:15Z","snapshot_observed_at":"2026-08-04T21:23:22.714033Z","submitted_at":"2024-02-23T02:15:47Z","title":"Interpreting Context Look-ups in Transformers: Investigating Attention-MLP Interactions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15055","snapshot_observed_at":"2026-07-31T23:32:08.031846Z","title":"URL https://arxiv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:08.031846Z"},"links":{"cited_paper":"/paper/2402.15055","citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:d275d115824902267b61fd51b6955e10a2bbe3be8cf2ba7f5478ae4d1a9cac88","observation_id":"85af495e-86d9-4a7c-9399-b9ad06412d46","resolution":{"observed_at":"2026-07-31T23:32:08.031846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:08.121092Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:08.121092Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:aa1e7eee8d63b2e9b32c50b64ac72641b17ace6d8ffafa5b573b1b62bfa61809","observation_id":"69cea7af-2428-4168-92c9-16f022bd1be3","resolution":{"observed_at":"2026-07-31T23:32:08.121092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:08.193745Z","title":", journal=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:08.193745Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:8895d954829c3e4990835cf7d8624c5e59960c19d6cc68c540c0f730f1d3b22c","observation_id":"27f9d751-4bfe-4302-9e66-a10176bafb1a","resolution":{"observed_at":"2026-07-31T23:32:08.193745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:08.264344Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:08.264344Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:72a22acd3bf125d14d687436945c212819b71007441c3392c20bc3ad97243b19","observation_id":"e569aecb-eecd-4626-a7ae-af00b51c0f19","resolution":{"observed_at":"2026-07-31T23:32:08.264344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-31T23:32:08.328608Z","title":"arXiv preprint arXiv:2302.13971 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:08.328608Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:c276333c021788e0ea7b9e0ba4a9112a04a0443659269cf09e0c38a0da79def9","observation_id":"28299060-3b33-4e01-93ae-ca41adf72799","resolution":{"observed_at":"2026-07-31T23:32:08.328608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:08.410958Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:08.410958Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:67dbd42308fc67198e4f576114a25dfdb0b7d3050c6fdd657ab2bbbe3c1ff7e0","observation_id":"49801071-9ee2-481c-9641-f786cbdab1b3","resolution":{"observed_at":"2026-07-31T23:32:08.410958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:08.467395Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:08.467395Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:19afaf675297280403cd0c47367efee690a77c588acd95791200c2d1233d390c","observation_id":"b4d2b48b-b435-48c3-ad95-14e5f0fff200","resolution":{"observed_at":"2026-07-31T23:32:08.467395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:08.548903Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:08.548903Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:fd02e2b2ff14adebbda92a6efc6f927b7b2c58bc2290d6d1bb58037bcd35da71","observation_id":"a3220ef5-daef-43da-97fd-2a650e65bbd3","resolution":{"observed_at":"2026-07-31T23:32:08.548903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.07490","last_updated":"2019-12-03T19:30:19Z","snapshot_observed_at":"2026-08-05T13:28:33.451106Z","submitted_at":"2019-08-20T17:05:18Z","title":"LXMERT: Learning Cross-Modality Encoder Representations from Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.07490","snapshot_observed_at":"2026-07-31T23:32:08.611396Z","title":"arXiv preprint arXiv:1908.07490 , year=","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:08.611396Z"},"links":{"cited_paper":"/paper/1908.07490","citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:66ffa80b26e1b3ba3e7fe081ea9f7d60bf450be2ce54e9b57da29ef153b2bbdb","observation_id":"7f6185bd-e797-4646-8163-e7b2fd376eef","resolution":{"observed_at":"2026-07-31T23:32:08.611396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:08.706948Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:08.706948Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:98213a78f18f2965157aca1064cc5bf8570b71252e9a780b3c06291122108b87","observation_id":"e319c7c3-7b15-4f25-8d24-d0c08c3e62f3","resolution":{"observed_at":"2026-07-31T23:32:08.706948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-07-31T23:32:08.760704Z","title":"arXiv preprint arXiv:2304.10592 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:08.760704Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:1549c6710bb3ff7391e86e6d85d84dff2f932181eb6a864ad63d81dbdec34125","observation_id":"678cb8c9-6cbc-48cd-b22b-7142340461a3","resolution":{"observed_at":"2026-07-31T23:32:08.760704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:08.822457Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:08.822457Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:9e44ea9075bc9c764b8f60691ed34bd9946abd2100102983f583a65b04c430aa","observation_id":"dddf9c65-7043-4418-883c-fd6ba843400f","resolution":{"observed_at":"2026-07-31T23:32:08.822457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:08.905738Z","title":"Findings of the Association for Computational Linguistics: ACL 2024 , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:08.905738Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:8394b03e04f0e127c1190c22ceb15cc83d63ea02ce19d84ff941971ab82bfab8","observation_id":"c9dd6358-6e76-422b-ac6d-73a244814923","resolution":{"observed_at":"2026-07-31T23:32:08.905738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00754","last_updated":"2024-03-16T19:28:08Z","snapshot_observed_at":"2026-08-02T06:11:56.496482Z","submitted_at":"2023-10-01T18:10:53Z","title":"Analyzing and Mitigating Object Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00754","snapshot_observed_at":"2026-07-31T23:32:08.978975Z","title":"arXiv preprint arXiv:2310.00754 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:08.978975Z"},"links":{"cited_paper":"/paper/2310.00754","citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:c79e3cf5f14242f02c4dcaba19a282a52abb2b82fe4d88ffe97545b05bd11f10","observation_id":"a8968e34-e0f8-445a-ad8b-7da358ac7a98","resolution":{"observed_at":"2026-07-31T23:32:08.978975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:09.046545Z","title":"ACM computing surveys , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:09.046545Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:85e547cc996d6416bb7be6d5617db0b490f32962d49f29b84ad20ab5fb67e17f","observation_id":"2ce00ea3-b6d0-4b68-b4f0-0cbb0103d861","resolution":{"observed_at":"2026-07-31T23:32:09.046545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01469","last_updated":"2024-08-04T16:26:14Z","snapshot_observed_at":"2026-07-06T16:26:42.253705Z","submitted_at":"2023-10-02T17:01:56Z","title":"LLM Lies: Hallucinations are not Bugs, but Features as Adversarial Examples","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01469","snapshot_observed_at":"2026-07-31T23:32:09.115033Z","title":"arXiv preprint arXiv:2310.01469 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:09.115033Z"},"links":{"cited_paper":"/paper/2310.01469","citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:3a4879702604da24d506920a206bd7db8e3675d5f024252920cc8bad24c0bba1","observation_id":"1a217f3e-185d-470b-b788-ed18225b3a77","resolution":{"observed_at":"2026-07-31T23:32:09.115033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:09.194942Z","title":"Computational Linguistics , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:09.194942Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:5fd1377c15d84d4350a40a645820cf59fcf4f4f54cac245b3aa276fd8c2c5a89","observation_id":"34daf07c-941f-419b-9068-7f3f81709208","resolution":{"observed_at":"2026-07-31T23:32:09.194942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:09.258355Z","title":"arXiv preprint arXiv:2404.00971 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:09.258355Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:f906e6ea2bc3ae19f0085c93977bb825b4cd8f99a08434d5a4e92c54ba76b7e7","observation_id":"bdd625dd-6010-4624-8faa-5647b8dd0238","resolution":{"observed_at":"2026-07-31T23:32:09.258355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11817","last_updated":"2025-02-13T08:11:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-22T10:26:14Z","title":"Hallucination is Inevitable: An Innate Limitation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11817","snapshot_observed_at":"2026-07-31T23:32:09.305673Z","title":"arXiv preprint arXiv:2401.11817 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:09.305673Z"},"links":{"cited_paper":"/paper/2401.11817","citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:afc71bcc34715af973063cd19cd1b7acc73a0a1d25f997d9eb4c6df9f1c9a6ed","observation_id":"74105b58-2de9-41bb-8c74-41f30d6f63cb","resolution":{"observed_at":"2026-07-31T23:32:09.305673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:09.384104Z","title":"Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:09.384104Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:ea425ed49d6ffbd6c9da5eae24fa3f61ac3adb4c657112fc34c9ff499be2a436","observation_id":"bad155bf-aab3-4ce1-a5c4-00ca8caa0171","resolution":{"observed_at":"2026-07-31T23:32:09.384104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-07-31T23:32:09.460993Z","title":"arXiv preprint arXiv:2305.10355 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:09.460993Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:14bd2640bb0a65a3d9e4bf4f5f525110185e37ce6ab5cdc3ed2bae22a9713451","observation_id":"67056763-db1c-42a3-abf7-27031e609961","resolution":{"observed_at":"2026-07-31T23:32:09.460993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:09.542715Z","title":"International Conference on Multimedia Modeling , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:09.542715Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:76654ff97abd76c541b72bbcbb838e6cf5f77e00daf89b0564df9e2b9d40d38e","observation_id":"219b91e4-d607-42db-bf5a-aa34ec7adc8f","resolution":{"observed_at":"2026-07-31T23:32:09.542715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:09.618628Z","title":"Science China Information Sciences , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:09.618628Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:bb7f3c7e8158252cd5c563bddadd7834ef9e2e29443227fac5c533508f87ecb3","observation_id":"5bb517a3-54cc-40a3-b910-834df831dd33","resolution":{"observed_at":"2026-07-31T23:32:09.618628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:09.675843Z","title":"Proceedings of the 32nd ACM International Conference on Multimedia , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:09.675843Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:422cf51a2ba9da3d50df3330d7e0a0741ae083e00af0ecad3558950a51099ed2","observation_id":"6cf268dd-d7a3-472f-8af1-a6375ccef507","resolution":{"observed_at":"2026-07-31T23:32:09.675843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:09.747298Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:09.747298Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:3bd5ef8f23a1fdfd3e6c78c32e5ca9b94800c9c508fdf9b790b663e8caf6bab2","observation_id":"6a0a2eca-8c67-41bc-b98a-69b2d3c849fe","resolution":{"observed_at":"2026-07-31T23:32:09.747298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19103","last_updated":"2024-02-29T12:35:45Z","snapshot_observed_at":"2026-08-04T09:21:09.405892Z","submitted_at":"2024-02-29T12:35:45Z","title":"Whispers that Shake Foundations: Analyzing and Mitigating False Premise Hallucinations in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19103","snapshot_observed_at":"2026-07-31T23:32:09.822111Z","title":"arXiv preprint arXiv:2402.19103 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:09.822111Z"},"links":{"cited_paper":"/paper/2402.19103","citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:46d7937a94c5809b2f98060176eaa076ab407a4458684eb40055bd71c3ea4e2e","observation_id":"9ed85e16-be04-4544-97c2-b5b610f5b69f","resolution":{"observed_at":"2026-07-31T23:32:09.822111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:09.883883Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:09.883883Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:e9c6534cb98f6eff24985982e6fffee7fc0177ec2f8472560d8de93fd8cf767b","observation_id":"598746ed-dde2-4591-b71d-52f6e632c03d","resolution":{"observed_at":"2026-07-31T23:32:09.883883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08276","last_updated":"2022-06-01T16:45:09Z","snapshot_observed_at":"2026-07-06T12:08:57.241574Z","submitted_at":"2021-11-16T07:55:26Z","title":"Multi-Grained Vision Language Pre-Training: Aligning Texts with Visual Concepts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.08276","snapshot_observed_at":"2026-07-31T23:32:09.979514Z","title":"arXiv preprint arXiv:2111.08276 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:09.979514Z"},"links":{"cited_paper":"/paper/2111.08276","citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:488fb07ad34001f62d24919849db6ca4152069370cd8108c4af7f69dd95786c3","observation_id":"37206346-f298-4f26-8e95-aa3023989e37","resolution":{"observed_at":"2026-07-31T23:32:09.979514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:10.058674Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:10.058674Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:c219e643a2a854ea9b7000eb573de8e7fc3bc61b4e0d6062dcaf3343ce59b7e4","observation_id":"3eed9a49-98c8-4079-b286-c1bf70c9a92f","resolution":{"observed_at":"2026-07-31T23:32:10.058674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03987","last_updated":"2023-08-12T14:57:37Z","snapshot_observed_at":"2026-08-04T09:02:49.602701Z","submitted_at":"2023-07-08T14:25:57Z","title":"A Stitch in Time Saves Nine: Detecting and Mitigating Hallucinations of LLMs by Validating Low-Confidence Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03987","snapshot_observed_at":"2026-07-31T23:32:10.117439Z","title":"arXiv preprint arXiv:2307.03987 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:10.117439Z"},"links":{"cited_paper":"/paper/2307.03987","citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:d9ec15afedd5742d79e46e754ce9e256fb403c1d073299c82a10c4a4d49a6393","observation_id":"f1f4a2c9-2987-45b3-ab40-b057bedd3de6","resolution":{"observed_at":"2026-07-31T23:32:10.117439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:10.194355Z","title":"Findings of the association for computational linguistics: ACL 2024 , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:10.194355Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:8c16d10470d249e965d3a6a75fdae8328123fdced6d24f6a54b6d9985ba50d9d","observation_id":"5b618d20-fa2a-4b64-a03c-06961a7754f4","resolution":{"observed_at":"2026-07-31T23:32:10.194355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11622","last_updated":"2024-06-28T07:20:22Z","snapshot_observed_at":"2026-07-06T17:31:50.029722Z","submitted_at":"2024-02-18T15:28:39Z","title":"Logical Closed Loop: Uncovering Object Hallucinations in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11622","snapshot_observed_at":"2026-07-31T23:32:10.267986Z","title":"arXiv preprint arXiv:2402.11622 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:10.267986Z"},"links":{"cited_paper":"/paper/2402.11622","citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:48446ad32b1d59876755dfee65261888f8e9c76db9e45cf160e88cd955951e94","observation_id":"16eb6a8d-8f59-429b-b403-5d0db347f6ca","resolution":{"observed_at":"2026-07-31T23:32:10.267986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:10.326808Z","title":"Proceedings of the 61st annual meeting of the association for computational linguistics (volume 1: Long papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:10.326808Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:a3ff51846768c4e1c132399d8b1b752345e19e46866d7f1a4e22bff7feeb8fd3","observation_id":"0726da5b-0223-40d1-bb04-0599b8362b74","resolution":{"observed_at":"2026-07-31T23:32:10.326808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03883","last_updated":"2024-03-11T02:01:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-07T17:45:31Z","title":"DoLa: Decoding by Contrasting Layers Improves Factuality in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03883","snapshot_observed_at":"2026-07-31T23:32:10.381568Z","title":"arXiv preprint arXiv:2309.03883 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:10.381568Z"},"links":{"cited_paper":"/paper/2309.03883","citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:8c528293aafa2fa50be10c96c8d46355cb29db6d2ee44c98861aa80294b4072d","observation_id":"56f3ae8b-a055-4031-93f7-fb11ac70d4fa","resolution":{"observed_at":"2026-07-31T23:32:10.381568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00233","last_updated":"2024-02-17T09:00:29Z","snapshot_observed_at":"2026-07-06T16:41:27.099792Z","submitted_at":"2023-11-01T02:31:35Z","title":"Instructive Decoding: Instruction-Tuned Large Language Models are Self-Refiner from Noisy Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00233","snapshot_observed_at":"2026-07-31T23:32:10.384309Z","title":"arXiv preprint arXiv:2311.00233 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:10.384309Z"},"links":{"cited_paper":"/paper/2311.00233","citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:d466fc2beed691c982bad203281a539cc2e4650d3752a9c149064262e420e8c9","observation_id":"74500154-a5e4-4ebf-baf6-09a8995e2beb","resolution":{"observed_at":"2026-07-31T23:32:10.384309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:10.386681Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:10.386681Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:3494847b8c3fff3c713ec4b20389c7b253040e66725263f11d131dbf98a8e1db","observation_id":"72de6184-b8e8-43b3-a44c-9ce4314d12c4","resolution":{"observed_at":"2026-07-31T23:32:10.386681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06130","last_updated":"2025-09-09T18:19:31Z","snapshot_observed_at":"2026-07-06T20:33:43.357335Z","submitted_at":"2025-02-10T03:43:55Z","title":"Self-Correcting Decoding with Generative Feedback for Mitigating Hallucinations in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06130","snapshot_observed_at":"2026-07-31T23:32:10.389429Z","title":"arXiv preprint arXiv:2502.06130 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:10.389429Z"},"links":{"cited_paper":"/paper/2502.06130","citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:f933eb3adb28f15db07775bbace93f7da268f272eaa7f21e5a62e56657ecec5a","observation_id":"aa062bbb-00ab-4ac8-87ac-6ffb9b307a72","resolution":{"observed_at":"2026-07-31T23:32:10.389429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02032","last_updated":"2025-03-16T06:51:13Z","snapshot_observed_at":"2026-07-06T18:56:40.234434Z","submitted_at":"2024-08-04T13:50:17Z","title":"Self-Introspective Decoding: Alleviating Hallucinations for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02032","snapshot_observed_at":"2026-07-31T23:32:10.392091Z","title":"arXiv preprint arXiv:2408.02032 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:10.392091Z"},"links":{"cited_paper":"/paper/2408.02032","citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:f754a0dba899f8c9c1da6fe6331317d3b324de66375e09557ba91de6f641cac8","observation_id":"9216b5b2-ae4e-46a2-8a96-56c265432c89","resolution":{"observed_at":"2026-07-31T23:32:10.392091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:10.517544Z","title":"2013 , publisher=","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:10.517544Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:a48241f1d3ae552c770b889915054dc8dd6d33e906301d203eceb93dfe6c4b7c","observation_id":"ea9c7e7d-5866-4312-8cf6-5ff9f15805e3","resolution":{"observed_at":"2026-07-31T23:32:10.517544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:10.625197Z","title":"Nature reviews neuroscience , volume=","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:10.625197Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:1a4e5d698b3f4a7215b4af8bd2a0ad056c5a2a9c4830c05764ced872bb6358b2","observation_id":"91f7536f-e94e-4139-9adc-cbc63510ce2c","resolution":{"observed_at":"2026-07-31T23:32:10.625197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:10.741701Z","title":"The Annals of Mathematical Statistics , volume=","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:10.741701Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:2901d0c93a3886fd9a438a4d5324e09a8ef78ba00bfdff61b9c4633718eae5ec","observation_id":"b995e4e9-66db-45ff-8bf6-49015027b673","resolution":{"observed_at":"2026-07-31T23:32:10.741701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:10.857848Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:10.857848Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:fdc9d9b7916f15da1fe783698d86f91bc10ddd9bb548dc09568521210fd4a0ca","observation_id":"f67abd66-dcd7-49cd-8cb0-eeebec68c240","resolution":{"observed_at":"2026-07-31T23:32:10.857848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:10.958733Z","title":"CCF International Conference on Natural Language Processing and Chinese Computing , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:10.958733Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:04d12d976949e49468991995270c6f4bf33fbc17b781e4fb83e8c637ac970f79","observation_id":"95c0e4c1-20d9-44ff-a8d0-9fa862edea7c","resolution":{"observed_at":"2026-07-31T23:32:10.958733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:11.064887Z","title":"2025 IEEE International Conference on Multimedia and Expo (ICME) , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:11.064887Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:66adc29cdc287825b8ae198ec7b5f70d0d7a64e33bd642fe1ed315722b9264fc","observation_id":"81d1a35f-2afa-4d7f-a732-1e03229b7358","resolution":{"observed_at":"2026-07-31T23:32:11.064887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:11.163522Z","title":"Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING 2024) , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:11.163522Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:d21075a0ae61790bf3518213ba60745bbcfdb9a5d4da9cbb769316cd4a7b90dd","observation_id":"fb03acc2-53b6-48e8-b5e1-28f83b98e125","resolution":{"observed_at":"2026-07-31T23:32:11.163522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:11.277909Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:11.277909Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:62682f09494d557c8962278fa2716e8f7c9d57c02b8187b8d070dcb1005aa58f","observation_id":"3a3b3715-7423-4a70-b4c7-6219ee2ffc2a","resolution":{"observed_at":"2026-07-31T23:32:11.277909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:11.422211Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:11.422211Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:29bea23436a8599055dd7fd3a91bedbad602b3c092f8b7331e4752c08fb12db8","observation_id":"970186df-c206-4712-bcbe-b516b400b110","resolution":{"observed_at":"2026-07-31T23:32:11.422211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:11.584947Z","title":"Proceedings of the Thirty-Fourth International Joint Conference on Artificial Intelligence , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:11.584947Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:892fb02ec8e127b363ca9cc0b206863029a367701f344b8585ef830ef0aba460","observation_id":"63cacc1c-39fb-4c9a-a47b-ccfdd0692896","resolution":{"observed_at":"2026-07-31T23:32:11.584947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:11.610299Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:11.610299Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:6315378b30655ae942c2e848b401c6d325a143799bade4781c2dd65e204aec94","observation_id":"31513c05-c41b-4c14-a54f-cf064d6306ce","resolution":{"observed_at":"2026-07-31T23:32:11.610299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:32:11.613357Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:11.613357Z"},"links":{"citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:e86fb7263dd6d75019e4ce5b0bce4848f72de77e77db849cb6b8831ae3cd7404","observation_id":"5027021e-b18f-407d-bffc-d5ec6313adfa","resolution":{"observed_at":"2026-07-31T23:32:11.613357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-04T17:56:14.053354Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":83,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 0 inbound Pith citation observations for arXiv:2607.23944."}