{"as_of":"2026-08-22T06:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:20aabd22def065ec910996fd2df8ab889711008fa170dc665d43238f8820f9d7","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T23:35:18.935031Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T16:34:34.452430Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T10:53:13.112211Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.05017","last_updated":"2026-06-07T15:01:12Z","snapshot_observed_at":"2026-08-15T17:28:17.283670Z","submitted_at":"2025-11-07T06:39:54Z","title":"Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings","version":2},"cited_work":{"arxiv_id":"2511.05017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.05017","snapshot_observed_at":"2026-06-09T02:06:07.552179Z","title":"arXiv preprint arXiv:2511.05017 (2025) 13","venue":null,"work_id":"798634c0-7474-462b-acfd-d461eca53705","year":2025},"citing_paper":{"arxiv_id":"2604.24583","last_updated":"2026-04-27T15:08:02Z","snapshot_observed_at":"2026-08-16T13:43:25.715649Z","submitted_at":"2026-04-27T15:08:02Z","title":"Improving Vision-language Models with Perception-centric Process Reward Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-08T04:33:36.634359Z"},"links":{"cited_paper":"/paper/2511.05017","citing_paper":"/paper/2604.24583"},"observation_digest":"sha256:15985e9fcdb58e80d9cd94ba13b97add9c1295c98d5c66082d1f753ea41ce874","observation_id":"6424e6d0-f282-4c6f-8ebe-d7823008e478","resolution":{"observed_at":"2026-06-09T02:06:07.552179Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.05017","last_updated":"2026-06-07T15:01:12Z","snapshot_observed_at":"2026-08-15T17:28:17.283670Z","submitted_at":"2025-11-07T06:39:54Z","title":"Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings","version":2},"cited_work":{"arxiv_id":"2511.05017","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.05017","snapshot_observed_at":"2026-06-09T02:06:07.552179Z","title":"arXiv preprint arXiv:2511.05017 (2025) 13","venue":null,"work_id":"798634c0-7474-462b-acfd-d461eca53705","year":2025},"citing_paper":{"arxiv_id":"2605.18603","last_updated":"2026-07-06T17:55:32Z","snapshot_observed_at":"2026-08-15T00:59:37.083546Z","submitted_at":"2026-05-18T16:13:09Z","title":"Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T10:52:32.238241Z"},"links":{"cited_paper":"/paper/2511.05017","citing_paper":"/paper/2605.18603"},"observation_digest":"sha256:e76149f3cf3bf88f786ba48e5d6f276357461e61ca8aace68baf9b7fb920b640","observation_id":"b2bad249-c48d-4360-862b-2468e6206f8f","resolution":{"observed_at":"2026-06-09T02:06:07.552179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.05017","last_updated":"2026-06-07T15:01:12Z","snapshot_observed_at":"2026-08-15T17:28:17.283670Z","submitted_at":"2025-11-07T06:39:54Z","title":"Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.05017","snapshot_observed_at":"2026-07-12T16:34:34.452430Z","title":"arXiv preprint arXiv:2511.05017 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.18603","last_updated":"2026-07-06T17:55:32Z","snapshot_observed_at":"2026-08-15T00:59:37.083546Z","submitted_at":"2026-05-18T16:13:09Z","title":"Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T16:34:34.452430Z"},"links":{"cited_paper":"/paper/2511.05017","citing_paper":"/paper/2605.18603"},"observation_digest":"sha256:248b97ea9a72ec4bbc89cf5d4c654fda2cae92ceeaad01c5e8bafeee0a62f406","observation_id":"f04da37e-6bc5-4ef1-8ca2-18823aaf51c4","resolution":{"observed_at":"2026-07-12T16:34:34.452430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2511.05017/citation-record","integrity":"/paper/2511.05017/integrity","json":"/paper/2511.05017/citation-record.json","paper":"/paper/2511.05017"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.15683","last_updated":"2025-03-06T03:59:59Z","snapshot_observed_at":"2026-08-21T22:15:37.607142Z","submitted_at":"2024-05-24T16:21:59Z","title":"Visual Description Grounding Reduces Hallucinations and Boosts Reasoning in LVLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15683","snapshot_observed_at":"2026-08-03T23:35:18.891961Z","title":"Visual description grounding reduces hallucinations and boosts reasoning in lvlms.arXiv preprint arXiv:2405.15683,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.05017","last_updated":"2026-06-07T15:01:12Z","snapshot_observed_at":"2026-08-15T17:28:17.283670Z","submitted_at":"2025-11-07T06:39:54Z","title":"Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T23:35:18.891961Z"},"links":{"cited_paper":"/paper/2405.15683","citing_paper":"/paper/2511.05017"},"observation_digest":"sha256:4e6716dca8c0f0376a749294a1666eb5673135aa302a500c8aba765a9a56173d","observation_id":"1d35fa9a-aab1-4ad8-932a-d20e71b3dccc","resolution":{"observed_at":"2026-08-03T23:35:18.891961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-16T14:17:37.981310Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-03T23:35:18.894715Z","title":"Efficientmultimodal learning from data-centric perspective.arXiv preprint arXiv:2402.11530,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.05017","last_updated":"2026-06-07T15:01:12Z","snapshot_observed_at":"2026-08-15T17:28:17.283670Z","submitted_at":"2025-11-07T06:39:54Z","title":"Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T23:35:18.894715Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2511.05017"},"observation_digest":"sha256:b04985758b1cbaedded8e7645e7c6f82d94e16c044359750dde0e725f25ab0fc","observation_id":"f088ccac-837a-4e8c-bd5f-478b8ee0fe35","resolution":{"observed_at":"2026-08-03T23:35:18.894715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:35:18.900175Z","title":"Faith: Faithful and informative textual hallucination detection in image captioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.05017","last_updated":"2026-06-07T15:01:12Z","snapshot_observed_at":"2026-08-15T17:28:17.283670Z","submitted_at":"2025-11-07T06:39:54Z","title":"Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T23:35:18.900175Z"},"links":{"citing_paper":"/paper/2511.05017"},"observation_digest":"sha256:f7e087550f90784899741f14b5212f1b50029453df71d14ad750ccf9dfa58ae9","observation_id":"494c1152-5089-467c-ab79-b9d9791b3a7f","resolution":{"observed_at":"2026-08-03T23:35:18.900175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:35:18.902642Z","title":"URL https://openaccess.thecvf.com/content/CVPR2023/html/Jing_FAITH_Faithful_ and_Informative_Textual_Hallucination_Detection_in_Image_Captioning_CVPR_2023_ paper.html","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.05017","last_updated":"2026-06-07T15:01:12Z","snapshot_observed_at":"2026-08-15T17:28:17.283670Z","submitted_at":"2025-11-07T06:39:54Z","title":"Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T23:35:18.902642Z"},"links":{"citing_paper":"/paper/2511.05017"},"observation_digest":"sha256:0e58d1bba2da2a3d24dfaa97f9e228859032e1a4cee65e587b8cba9f5b50ea63","observation_id":"ab1d5f5b-58db-4c43-96dc-a236dae7fbf0","resolution":{"observed_at":"2026-08-03T23:35:18.902642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-03T23:35:18.905058Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.05017","last_updated":"2026-06-07T15:01:12Z","snapshot_observed_at":"2026-08-15T17:28:17.283670Z","submitted_at":"2025-11-07T06:39:54Z","title":"Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T23:35:18.905058Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2511.05017"},"observation_digest":"sha256:23c0153b300d9e8660945225f95ede80c1ac2f3c8ec51235c2326cc2b8d0efdc","observation_id":"a6840d9a-8e78-4a18-b8ae-34c1947da9df","resolution":{"observed_at":"2026-08-03T23:35:18.905058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02571","last_updated":"2025-02-22T05:33:26Z","snapshot_observed_at":"2026-08-21T10:39:36.642494Z","submitted_at":"2024-11-04T20:06:34Z","title":"MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02571","snapshot_observed_at":"2026-08-03T23:35:18.907951Z","title":"Haotian Liu, Chunyuan Li, Yuheng Li, and Yong Jae Lee","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.05017","last_updated":"2026-06-07T15:01:12Z","snapshot_observed_at":"2026-08-15T17:28:17.283670Z","submitted_at":"2025-11-07T06:39:54Z","title":"Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T23:35:18.907951Z"},"links":{"cited_paper":"/paper/2411.02571","citing_paper":"/paper/2511.05017"},"observation_digest":"sha256:73f432ed28410c8ecf67ec6ae28d8640a6d766dec42442a8989ed05b435583b6","observation_id":"066a815b-5d7f-4b47-b465-4e705632a3ae","resolution":{"observed_at":"2026-08-03T23:35:18.907951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:35:18.910544Z","title":"URL https: //openaccess.thecvf.com/content/ICCV2023/html/Lovenia_NOPE_Evaluating_and_ Explaining_Negative_Object_Presence_in_Image_Captioning_ICCV_2023_paper.html","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.05017","last_updated":"2026-06-07T15:01:12Z","snapshot_observed_at":"2026-08-15T17:28:17.283670Z","submitted_at":"2025-11-07T06:39:54Z","title":"Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T23:35:18.910544Z"},"links":{"citing_paper":"/paper/2511.05017"},"observation_digest":"sha256:7b072fccf8f08b7d75100a991d1c8683c608485455f9ede7564f70f951a16700","observation_id":"6513c6f1-6fa2-46c8-8b5f-2dc6ed8e91f0","resolution":{"observed_at":"2026-08-03T23:35:18.910544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:35:18.913235Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05017","last_updated":"2026-06-07T15:01:12Z","snapshot_observed_at":"2026-08-15T17:28:17.283670Z","submitted_at":"2025-11-07T06:39:54Z","title":"Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T23:35:18.913235Z"},"links":{"citing_paper":"/paper/2511.05017"},"observation_digest":"sha256:8b4c02918138b5a29c19aeb311626dd4fe57c0d9278479777ff38fa8961b8d97","observation_id":"d1720cf9-477e-437e-8ee6-b2508fcc5b00","resolution":{"observed_at":"2026-08-03T23:35:18.913235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:35:18.915633Z","title":"Aloha: Assessing language-only hallucinations in image captioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.05017","last_updated":"2026-06-07T15:01:12Z","snapshot_observed_at":"2026-08-15T17:28:17.283670Z","submitted_at":"2025-11-07T06:39:54Z","title":"Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T23:35:18.915633Z"},"links":{"citing_paper":"/paper/2511.05017"},"observation_digest":"sha256:f8da457e5130f2edc4c3ef3ac423156d9e029f4395f62e3329842296756cb608","observation_id":"a871f417-af15-47d5-9f2c-c4a47cde47be","resolution":{"observed_at":"2026-08-03T23:35:18.915633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00704","last_updated":"2023-12-01T16:39:28Z","snapshot_observed_at":"2026-08-16T14:38:25.204931Z","submitted_at":"2023-12-01T16:39:28Z","title":"Moments of the Poisson distribution of order $k$","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00704","snapshot_observed_at":"2026-08-03T23:35:18.918106Z","title":"URL https://aclanthology.org/2023.emnlp-main.567/","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.05017","last_updated":"2026-06-07T15:01:12Z","snapshot_observed_at":"2026-08-15T17:28:17.283670Z","submitted_at":"2025-11-07T06:39:54Z","title":"Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T23:35:18.918106Z"},"links":{"cited_paper":"/paper/2312.00704","citing_paper":"/paper/2511.05017"},"observation_digest":"sha256:d6445985afc3557b7cb5e8702fec63a2275856e53c5bc7ce7590209fa63c9833","observation_id":"96f42c52-834a-4756-ad4a-1f47a3c891dd","resolution":{"observed_at":"2026-08-03T23:35:18.918106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02219","last_updated":"2025-05-30T11:40:41Z","snapshot_observed_at":"2026-08-20T03:00:49.082600Z","submitted_at":"2023-12-03T16:39:36Z","title":"Behind the Magic, MERLIM: Multi-modal Evaluation Benchmark for Large Image-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02219","snapshot_observed_at":"2026-08-03T23:35:18.920899Z","title":"Behind the magic, merlim: Multi-modal evaluation benchmark for large image-language models.arXiv preprint arXiv:2312.02219,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.05017","last_updated":"2026-06-07T15:01:12Z","snapshot_observed_at":"2026-08-15T17:28:17.283670Z","submitted_at":"2025-11-07T06:39:54Z","title":"Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T23:35:18.920899Z"},"links":{"cited_paper":"/paper/2312.02219","citing_paper":"/paper/2511.05017"},"observation_digest":"sha256:17df7314635f4cef0d37ca0d1a68c774c016c0c9dc8ad3b3c23f9648106a64dc","observation_id":"c1f68f37-682c-48da-bb34-d2e721074214","resolution":{"observed_at":"2026-08-03T23:35:18.920899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-21T17:29:12.301309Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02699","snapshot_observed_at":"2026-08-03T23:35:18.923981Z","title":"Eagle: Enhanced visual grounding minimizes hallucinations in instructional multimodal models.arXiv preprint arXiv:2501.02699,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.05017","last_updated":"2026-06-07T15:01:12Z","snapshot_observed_at":"2026-08-15T17:28:17.283670Z","submitted_at":"2025-11-07T06:39:54Z","title":"Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T23:35:18.923981Z"},"links":{"cited_paper":"/paper/2501.02699","citing_paper":"/paper/2511.05017"},"observation_digest":"sha256:325b3710d882a94d63dd042645ca021474e5d1c95befe3a090e0fc5b79f999e3","observation_id":"e52a1569-1195-4c37-a629-46c10e323306","resolution":{"observed_at":"2026-08-03T23:35:18.923981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10529","last_updated":"2024-01-25T04:11:57Z","snapshot_observed_at":"2026-08-18T12:57:58.880281Z","submitted_at":"2024-01-19T07:10:13Z","title":"Mementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image Sequences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10529","snapshot_observed_at":"2026-08-03T23:35:18.926817Z","title":"Mementos: A comprehensive benchmark for multimodal large language model reasoning over image sequences.arXiv preprint arXiv:2401.10529, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.05017","last_updated":"2026-06-07T15:01:12Z","snapshot_observed_at":"2026-08-15T17:28:17.283670Z","submitted_at":"2025-11-07T06:39:54Z","title":"Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T23:35:18.926817Z"},"links":{"cited_paper":"/paper/2401.10529","citing_paper":"/paper/2511.05017"},"observation_digest":"sha256:b087e0896d9b579616472b5bbe7d881dcd8a5a02c34188ca09721bfcda5d28c1","observation_id":"8b18b037-8b02-4f4e-86ca-244c91950496","resolution":{"observed_at":"2026-08-03T23:35:18.926817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01852","last_updated":"2024-01-22T03:11:15Z","snapshot_observed_at":"2026-08-16T17:54:32.088103Z","submitted_at":"2023-10-03T07:33:27Z","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01852","snapshot_observed_at":"2026-08-03T23:35:18.929446Z","title":"Languagebind: Extending video-language pretraining to n-modality by language-based semantic alignment.arXiv preprint arXiv:2310.01852, 2023a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.05017","last_updated":"2026-06-07T15:01:12Z","snapshot_observed_at":"2026-08-15T17:28:17.283670Z","submitted_at":"2025-11-07T06:39:54Z","title":"Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T23:35:18.929446Z"},"links":{"cited_paper":"/paper/2310.01852","citing_paper":"/paper/2511.05017"},"observation_digest":"sha256:cd4509197f6412ba97817490e38217e430dc271f4fb85ae77872c4e7c735dd75","observation_id":"3d575566-45a9-419f-a1f3-548f984800a2","resolution":{"observed_at":"2026-08-03T23:35:18.929446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:35:18.932326Z","title":"We evaluate the individual and combined effects of Visual Contrastive Decoding (VCD), and VisAlign","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.05017","last_updated":"2026-06-07T15:01:12Z","snapshot_observed_at":"2026-08-15T17:28:17.283670Z","submitted_at":"2025-11-07T06:39:54Z","title":"Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T23:35:18.932326Z"},"links":{"citing_paper":"/paper/2511.05017"},"observation_digest":"sha256:38990542f081af97fa0f27d5a6bd86057170bbaa7c44866ec8516573d145a29d","observation_id":"c59ee11f-0d63-4839-b71d-d11eb97f3df8","resolution":{"observed_at":"2026-08-03T23:35:18.932326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:35:18.935031Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.05017","last_updated":"2026-06-07T15:01:12Z","snapshot_observed_at":"2026-08-15T17:28:17.283670Z","submitted_at":"2025-11-07T06:39:54Z","title":"Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T23:35:18.935031Z"},"links":{"citing_paper":"/paper/2511.05017"},"observation_digest":"sha256:85fcd7eae96c62107a87cbdef0d58e6b3cc8e75aa04830e20ea0390eb58cf156","observation_id":"e1256842-56d7-42c9-8bc9-d7a31a482739","resolution":{"observed_at":"2026-08-03T23:35:18.935031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-03T23:35:18.885878Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models.arXiv preprint arXiv:2306.13394, 3,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.05017","last_updated":"2026-06-07T15:01:12Z","snapshot_observed_at":"2026-08-15T17:28:17.283670Z","submitted_at":"2025-11-07T06:39:54Z","title":"Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T23:35:18.885878Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2511.05017"},"observation_digest":"sha256:acb6b7e884e5c708bc18dd6730b4d9d1a449ad855d605896336334ac65d3928b","observation_id":"0ef1a681-eb6e-43c6-b5d3-5aae4a26879d","resolution":{"observed_at":"2026-08-03T23:35:18.885878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-08-19T06:18:29.748887Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-08-03T23:35:18.888887Z","title":"Pali: A jointly-scaled multilingual language-image model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.05017","last_updated":"2026-06-07T15:01:12Z","snapshot_observed_at":"2026-08-15T17:28:17.283670Z","submitted_at":"2025-11-07T06:39:54Z","title":"Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T23:35:18.888887Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2511.05017"},"observation_digest":"sha256:cb0e76f843b8f8629ddbba4474db58036e58d67f61581db1ca10a2470b360a41","observation_id":"ebb7a317-260c-4608-843f-a1d651a4ee3c","resolution":{"observed_at":"2026-08-03T23:35:18.888887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:35:18.897419Z","title":"Mitigating object hallucinations in large vision-language models via attention calibration","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.05017","last_updated":"2026-06-07T15:01:12Z","snapshot_observed_at":"2026-08-15T17:28:17.283670Z","submitted_at":"2025-11-07T06:39:54Z","title":"Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T23:35:18.897419Z"},"links":{"citing_paper":"/paper/2511.05017"},"observation_digest":"sha256:20983dd896c678290678adf38fa97acb2a9cdf879d3ab16a1ce60f762228eaa1","observation_id":"f5abee2a-0f4c-46ad-88f0-8ad0a3f1288e","resolution":{"observed_at":"2026-08-03T23:35:18.897419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12206","last_updated":"2025-03-26T01:49:37Z","snapshot_observed_at":"2026-08-15T14:41:39.098469Z","submitted_at":"2025-01-21T15:22:31Z","title":"PAINT: Paying Attention to INformed Tokens to Mitigate Hallucination in Large Vision-Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12206","snapshot_observed_at":"2026-08-03T23:35:18.882276Z","title":"Paint: Paying attention to informed tokens to mitigate hallucination in large vision-language model.arXiv preprint arXiv:2501.12206,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.05017","last_updated":"2026-06-07T15:01:12Z","snapshot_observed_at":"2026-08-15T17:28:17.283670Z","submitted_at":"2025-11-07T06:39:54Z","title":"Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T23:35:18.882276Z"},"links":{"cited_paper":"/paper/2501.12206","citing_paper":"/paper/2511.05017"},"observation_digest":"sha256:22cc928ce5c1800889409d9d0056f47fa9002982cd2c684c1256ed5208b139f3","observation_id":"55ad7066-1187-4b0e-98f2-ea60b2651ddd","resolution":{"observed_at":"2026-08-03T23:35:18.882276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.05017","last_updated":"2026-06-07T15:01:12Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T17:28:17.283670Z","submitted_at":"2025-11-07T06:39:54Z","title":"Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 3 inbound Pith citation observations for arXiv:2511.05017."}