{"as_of":"2026-08-08T23:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:284ca148a462b405a939401b14ec8994930d20ce2e8baad21f6601192a6cf4af","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:43:37.428548Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.07184/citation-record","integrity":"/paper/2506.07184/integrity","json":"/paper/2506.07184/citation-record.json","paper":"/paper/2506.07184"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:28.909282Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:28.909282Z"},"links":{"citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:7754b78d94176f87715418d4210c0131979e5999e5d6d4dab3f867cbd16db316","observation_id":"111fc2c7-733f-452a-9b5d-7c45e28737ef","resolution":{"observed_at":"2026-08-07T05:43:28.909282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:29.080116Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:29.080116Z"},"links":{"citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:27a9148ccabb6577003018fdac449a32893bcfa25bf1fb3daa78589af7757a52","observation_id":"b67c614e-8e40-4e7d-833d-8032fc1e8cf8","resolution":{"observed_at":"2026-08-07T05:43:29.080116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12257","last_updated":"2024-09-18T18:40:02Z","snapshot_observed_at":"2026-08-03T16:39:28.107706Z","submitted_at":"2024-09-18T18:40:02Z","title":"MQA-KEAL: Multi-hop Question Answering under Knowledge Editing for Arabic Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12257","snapshot_observed_at":"2026-08-07T05:43:29.212447Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:29.212447Z"},"links":{"cited_paper":"/paper/2409.12257","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:050bd1da9fbe3dd12becb483005d8c351d99d2654f94bf424805ee07fcacc798","observation_id":"012614e4-d3e2-41f8-a734-d9df73f633e1","resolution":{"observed_at":"2026-08-07T05:43:29.212447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T05:43:29.354283Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:29.354283Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:a8e6ad5f5e4e7699a8142c2a28e2cbc171e7a18183dedce0bfa4da8851858738","observation_id":"1fb1ffda-dbe0-47ca-9915-8cd0a9284331","resolution":{"observed_at":"2026-08-07T05:43:29.354283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03631","last_updated":"2024-10-16T19:35:55Z","snapshot_observed_at":"2026-07-06T16:57:51.263433Z","submitted_at":"2023-12-06T17:28:03Z","title":"Mitigating Open-Vocabulary Caption Hallucinations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03631","snapshot_observed_at":"2026-08-07T05:43:29.493103Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:29.493103Z"},"links":{"cited_paper":"/paper/2312.03631","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:4827dcc2e7ab156fb2f787dabe74cf2f36e78a8af55518a57115e5bfda556e01","observation_id":"2a352a90-f6f3-4c94-8df6-283947b7bd73","resolution":{"observed_at":"2026-08-07T05:43:29.493103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05243","last_updated":"2024-12-06T18:22:47Z","snapshot_observed_at":"2026-08-07T19:37:53.427741Z","submitted_at":"2024-12-06T18:22:47Z","title":"CompCap: Improving Multimodal Large Language Models with Composite Captions","version":1},"cited_work":{"arxiv_id":"2412.05243","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.05243","snapshot_observed_at":"2026-08-07T05:43:39.016056Z","title":"CompCap: Improving Multimodal Large Language Models with Composite Captions","venue":"cs.CV","work_id":"fd92fcd0-6bad-436b-be44-ffba5890a824","year":2024},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:29.621031Z"},"links":{"cited_paper":"/paper/2412.05243","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:fd9a88654573f847fa15f8feaca9e7a06a3a5bf85a03c14f046a517f086a7e6b","observation_id":"b94b2238-39c5-41da-a667-77f2a8750e6f","resolution":{"observed_at":"2026-08-07T05:43:39.103644Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00425","last_updated":"2024-06-10T15:21:41Z","snapshot_observed_at":"2026-08-07T09:16:51.378562Z","submitted_at":"2024-03-01T10:21:52Z","title":"HALC: Object Hallucination Reduction via Adaptive Focal-Contrast Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00425","snapshot_observed_at":"2026-08-07T05:43:29.824690Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:29.824690Z"},"links":{"cited_paper":"/paper/2403.00425","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:bfbfcf7759847a95a812c2e880d9388bf94aad5d5cf7ae07e63168fbdf5454dc","observation_id":"d60ae036-b131-4d17-8c9b-5716289c46d7","resolution":{"observed_at":"2026-08-07T05:43:29.824690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-07T05:43:29.994657Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:29.994657Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:78bfa6ed50ac3ac9862593a4aed6dd41b12d6d10f605fe15968ec33bf532dd69","observation_id":"2f096af6-601c-47ae-a3b2-8a7e6cf9eff0","resolution":{"observed_at":"2026-08-07T05:43:29.994657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00829","last_updated":"2025-06-03T16:03:55Z","snapshot_observed_at":"2026-08-08T08:18:37.701965Z","submitted_at":"2025-06-01T04:26:46Z","title":"COMPKE: Complex Question Answering under Knowledge Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00829","snapshot_observed_at":"2026-08-07T05:43:30.125296Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:30.125296Z"},"links":{"cited_paper":"/paper/2506.00829","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:7f17f54ce06b77cc1bad73e2d1709da1daa19ed4170dbe93096499f1ed6d8396","observation_id":"9cf5b3d2-a51d-4b6b-b03f-e8726ec02d00","resolution":{"observed_at":"2026-08-07T05:43:30.125296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00492","last_updated":"2024-03-30T23:22:51Z","snapshot_observed_at":"2026-07-06T17:53:31.221833Z","submitted_at":"2024-03-30T23:22:51Z","title":"Multi-hop Question Answering under Temporal Knowledge Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00492","snapshot_observed_at":"2026-08-07T05:43:30.256624Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:30.256624Z"},"links":{"cited_paper":"/paper/2404.00492","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:cb9b90bc39865657f1e818ac2db461e5d62d676284c911b7d8c65d5ef4104a2d","observation_id":"b4bed4a9-c70e-472c-b6be-95df02d80479","resolution":{"observed_at":"2026-08-07T05:43:30.256624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00894","last_updated":"2025-06-01T08:29:59Z","snapshot_observed_at":"2026-08-08T06:52:26.040488Z","submitted_at":"2025-06-01T08:29:59Z","title":"CODEMENV: Benchmarking Large Language Models on Code Migration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00894","snapshot_observed_at":"2026-08-07T05:43:30.379749Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:30.379749Z"},"links":{"cited_paper":"/paper/2506.00894","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:520f4828c499166c99a363258eb99500e8ac9c0f989e259bc598fe052e8f3c18","observation_id":"cdb28e38-59cd-4712-8749-c39d55b7c548","resolution":{"observed_at":"2026-08-07T05:43:30.379749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15300","last_updated":"2024-04-23T09:32:25Z","snapshot_observed_at":"2026-07-06T17:34:32.617468Z","submitted_at":"2024-02-23T12:57:16Z","title":"Seeing is Believing: Mitigating Hallucination in Large Vision-Language Models via CLIP-Guided Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15300","snapshot_observed_at":"2026-08-07T05:43:30.548053Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:30.548053Z"},"links":{"cited_paper":"/paper/2402.15300","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:5bbbe49820831fa3f2e705e1aff74b0173c49975383b713ab81d4a36e0073a6e","observation_id":"f5ce18c0-7c9d-47af-861d-958057782d70","resolution":{"observed_at":"2026-08-07T05:43:30.548053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T05:43:30.658007Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:30.658007Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:9cae695895f99cb12959a56a6217b96db0e0bcea39ffaf180c253300d0c26435","observation_id":"eb5c7f6a-b35d-4f78-ba9e-305312326454","resolution":{"observed_at":"2026-08-07T05:43:30.658007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.08571","last_updated":"2023-01-20T13:38:24Z","snapshot_observed_at":"2026-07-06T14:43:08.776338Z","submitted_at":"2023-01-20T13:38:24Z","title":"Visual Writing Prompts: Character-Grounded Story Generation with Curated Image Sequences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.08571","snapshot_observed_at":"2026-08-07T05:43:30.796251Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:30.796251Z"},"links":{"cited_paper":"/paper/2301.08571","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:3ece4e198ad6e28b949558ebf8b078fae8892bf42fc9088babf2c9242f25de5c","observation_id":"01f3c5dd-3e8e-4e60-bab4-deae4d053a67","resolution":{"observed_at":"2026-08-07T05:43:30.796251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03595","last_updated":"2024-10-04T16:55:30Z","snapshot_observed_at":"2026-08-06T22:02:11.445627Z","submitted_at":"2024-10-04T16:55:30Z","title":"Understanding Reasoning in Chain-of-Thought from the Hopfieldian View","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03595","snapshot_observed_at":"2026-08-07T05:43:30.956139Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:30.956139Z"},"links":{"cited_paper":"/paper/2410.03595","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:79295e6c12b2e7dbf9e58b90f4aa9e8cd2ce8cd6e05281884f84f063eea9e679","observation_id":"38a2dbc8-22ea-4866-9c55-3092568ab4c3","resolution":{"observed_at":"2026-08-07T05:43:30.956139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:39.384466Z","title":null,"venue":null,"work_id":"56ff24ae-aa5a-4b1b-84fc-1111961c42cf","year":2025},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:31.117116Z"},"links":{"citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:a190c758d264858dc1027b9ec5e826d362259ef3e0912fed07196f3dbc61efdb","observation_id":"da0dabff-15c0-4d10-bd66-3fcab9e86af0","resolution":{"observed_at":"2026-08-07T05:43:39.448977Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:31.284019Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:31.284019Z"},"links":{"citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:b16d3fdc1f99770ff5d4408d07f93abc0243010052b8324218e582f80dbe8fd1","observation_id":"711e6788-07e1-48e5-a2fe-3d0c0b05f705","resolution":{"observed_at":"2026-08-07T05:43:31.284019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.03968","last_updated":"2016-04-13T20:27:43Z","snapshot_observed_at":"2026-08-05T23:43:02.349652Z","submitted_at":"2016-04-13T20:27:43Z","title":"Visual Storytelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.03968","snapshot_observed_at":"2026-08-07T05:43:31.429338Z","title":"Lawrence Zitnick, Devi Parikh, Lucy Vanderwende, Michel Galley, and Margaret Mitchell","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:31.429338Z"},"links":{"cited_paper":"/paper/1604.03968","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:b3385189688aff96436fb9b43b531ff7d62a681e1881dc3641e2fd1dca5da447","observation_id":"dc9b9371-d765-47f5-9df4-1cf77f494c93","resolution":{"observed_at":"2026-08-07T05:43:31.429338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14233","last_updated":"2023-12-21T18:49:47Z","snapshot_observed_at":"2026-07-06T17:06:50.350562Z","submitted_at":"2023-12-21T18:49:47Z","title":"VCoder: Versatile Vision Encoders for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14233","snapshot_observed_at":"2026-08-07T05:43:31.570069Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:31.570069Z"},"links":{"cited_paper":"/paper/2312.14233","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:07ce189df6915df4226d461c6ea170ff9a194a9aaba30c100953363c7cc84684","observation_id":"1cd5d190-9626-4add-b0dd-78d1d0d58adf","resolution":{"observed_at":"2026-08-07T05:43:31.570069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08256","last_updated":"2023-10-12T12:01:32Z","snapshot_observed_at":"2026-08-06T19:16:47.960949Z","submitted_at":"2023-10-12T12:01:32Z","title":"Impact of Co-occurrence on Factual Knowledge of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08256","snapshot_observed_at":"2026-08-07T05:43:31.654812Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:31.654812Z"},"links":{"cited_paper":"/paper/2310.08256","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:c6f61118ddfb8aaa8695dca9c96ceab9a16a7df2183ece92c78d55ede1c342b6","observation_id":"64e76a39-7d0f-40af-bcf2-1dee11ab4ffd","resolution":{"observed_at":"2026-08-07T05:43:31.654812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/1017715","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:38.601497Z","title":null,"venue":null,"work_id":"1be93663-7c04-49cf-b76e-30005c831fb2","year":2025},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:31.771651Z"},"links":{"citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:c99a661950f9b7638649ca690f6ffb4bb4649a69a53a1d66333d2735210b51a1","observation_id":"a17236b2-5d6f-466d-9cce-f70c5bbd4cc3","resolution":{"observed_at":"2026-08-07T05:43:38.712484Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07362","last_updated":"2024-04-02T04:12:43Z","snapshot_observed_at":"2026-07-06T16:46:38.855912Z","submitted_at":"2023-11-13T14:26:24Z","title":"Volcano: Mitigating Multimodal Hallucination through Self-Feedback Guided Revision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07362","snapshot_observed_at":"2026-08-07T05:43:31.958836Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:31.958836Z"},"links":{"cited_paper":"/paper/2311.07362","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:33efbb14fb80ff59e4c1df4b98ccab9e7e575d0db71b5e3702c234c1f23cfdf1","observation_id":"f6fb1741-6866-4fca-9506-033c48b0471e","resolution":{"observed_at":"2026-08-07T05:43:31.958836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16922","last_updated":"2023-11-28T16:26:35Z","snapshot_observed_at":"2026-08-07T09:15:01.742397Z","submitted_at":"2023-11-28T16:26:35Z","title":"Mitigating Object Hallucinations in Large Vision-Language Models through Visual Contrastive Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16922","snapshot_observed_at":"2026-08-07T05:43:32.054370Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:32.054370Z"},"links":{"cited_paper":"/paper/2311.16922","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:130788b9a2bc26d85da2eb22561cad24f97ccabec641e7c653e253d2221dd889","observation_id":"3843924e-01e0-4a07-8f1d-c592b3faf994","resolution":{"observed_at":"2026-08-07T05:43:32.054370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:32.215608Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:32.215608Z"},"links":{"citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:b6508a291cd3bc5f31b3d16d3092dab6a7b7d4a4ac0683eba2ac33f170214737","observation_id":"6a39cfc3-04d6-4c0b-b2b0-39489b4df711","resolution":{"observed_at":"2026-08-07T05:43:32.215608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T05:43:32.346113Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:32.346113Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:1b929a63501a045032c90377dda9f32ef472749969484923db58cdeb75f57d48","observation_id":"8e0331ae-51a8-4cb6-8e55-52176c76e3ad","resolution":{"observed_at":"2026-08-07T05:43:32.346113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T05:43:32.559182Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:32.559182Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:4d09f07d5bb37c51155833bbf413e5773d559dfabe4efa189fb18c09df188344","observation_id":"ba1f3937-444b-4ad9-b686-4a5cf4401404","resolution":{"observed_at":"2026-08-07T05:43:32.559182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-07T05:43:32.677434Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:32.677434Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:df6a7535776bd306f35e5e1d740eadbfb2abcfa20c6d0e32e0a516b874355761","observation_id":"e0d7a00e-9e6c-42b1-ad39-fd7c91070a70","resolution":{"observed_at":"2026-08-07T05:43:32.677434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-06T22:33:34.254048Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-07T05:43:32.833086Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:32.833086Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:a191b0745d0a0a5dcf9dbac445100ee1a5ac7d7561609d6165303ec88c2054d3","observation_id":"625e8ce7-77c7-4f2b-8269-15d0c3c31bbd","resolution":{"observed_at":"2026-08-07T05:43:32.833086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13805","last_updated":"2026-05-15T05:14:37Z","snapshot_observed_at":"2026-07-06T17:47:51.284226Z","submitted_at":"2024-03-20T17:59:55Z","title":"RAR: Retrieving And Ranking Augmented MLLMs for Visual Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13805","snapshot_observed_at":"2026-08-07T05:43:32.970624Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:32.970624Z"},"links":{"cited_paper":"/paper/2403.13805","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:3d975eea7e05c89df9b3c1bf16e8874b7a878aca1d46fe8995420f8b52ca9934","observation_id":"36a2220f-1c7a-41b4-b518-01f269093948","resolution":{"observed_at":"2026-08-07T05:43:32.970624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08870","last_updated":"2025-03-03T17:58:12Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-12T09:47:59Z","title":"Vista-LLaMA: Reducing Hallucination in Video Language Models via Equal Distance to Visual Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08870","snapshot_observed_at":"2026-08-07T05:43:33.190355Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:33.190355Z"},"links":{"cited_paper":"/paper/2312.08870","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:c3eaeb8849a02d9c7989057120f516c38195a978db526fb90c0353ac4c858692","observation_id":"73b8ef74-1160-4320-a0b4-1d300b3dc3c7","resolution":{"observed_at":"2026-08-07T05:43:33.190355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02156","last_updated":"2019-03-29T23:48:52Z","snapshot_observed_at":"2026-08-04T05:57:07.163978Z","submitted_at":"2018-09-06T18:25:18Z","title":"Object Hallucination in Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02156","snapshot_observed_at":"2026-08-07T05:43:33.360788Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:33.360788Z"},"links":{"cited_paper":"/paper/1809.02156","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:f7de26495ab334f9f0a5da36f43bda5428b3848c49a935d7f3c5c35287fad114","observation_id":"a94121d6-81fa-418c-a4c3-2e22b46e06bb","resolution":{"observed_at":"2026-08-07T05:43:33.360788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05540","last_updated":"2023-05-23T11:18:30Z","snapshot_observed_at":"2026-07-06T15:40:31.399348Z","submitted_at":"2023-05-23T11:18:30Z","title":"DetectLLM: Leveraging Log Rank Information for Zero-Shot Detection of Machine-Generated Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05540","snapshot_observed_at":"2026-08-07T05:43:33.542883Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:33.542883Z"},"links":{"cited_paper":"/paper/2306.05540","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:335fa07695f3c7d1dd0594cc5c0249e4390f569d9c7ee83ab40fe353619cc898","observation_id":"6430213c-415f-49bc-9e8b-72f65a81e8c3","resolution":{"observed_at":"2026-08-07T05:43:33.542883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-07T05:43:33.757497Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:33.757497Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:4035a2fcd0b7fab74479d1526851a779fe6fa79f310a325e5978036f456a4c45","observation_id":"628dbd07-89b3-4e86-967a-d51d92f129e4","resolution":{"observed_at":"2026-08-07T05:43:33.757497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02219","last_updated":"2025-05-30T11:40:41Z","snapshot_observed_at":"2026-08-08T00:04:39.847686Z","submitted_at":"2023-12-03T16:39:36Z","title":"Behind the Magic, MERLIM: Multi-modal Evaluation Benchmark for Large Image-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02219","snapshot_observed_at":"2026-08-07T05:43:33.934149Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:33.934149Z"},"links":{"cited_paper":"/paper/2312.02219","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:baf41edfc9e76fe8032ff597aa99d692668c69e59875141407c061c1490c80e0","observation_id":"0933451b-f5f2-4c78-8abe-84314733f6a8","resolution":{"observed_at":"2026-08-07T05:43:33.934149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11779","last_updated":"2025-02-23T15:14:47Z","snapshot_observed_at":"2026-08-04T10:14:38.406056Z","submitted_at":"2024-10-15T16:57:44Z","title":"MLLM can see? Dynamic Correction Decoding for Hallucination Mitigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11779","snapshot_observed_at":"2026-08-07T05:43:34.142890Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:34.142890Z"},"links":{"cited_paper":"/paper/2410.11779","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:70295b52fc0847ac3dc9b3e68e41408aad94eb31eceda3ccb82bf2772d798305","observation_id":"311beac4-0ceb-43c2-acdf-9bd79457968a","resolution":{"observed_at":"2026-08-07T05:43:34.142890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01701","last_updated":"2023-12-04T07:43:02Z","snapshot_observed_at":"2026-07-06T16:56:25.554848Z","submitted_at":"2023-12-04T07:43:02Z","title":"Mitigating Fine-Grained Hallucination by Fine-Tuning Large Vision-Language Models with Caption Rewrites","version":1},"cited_work":{"arxiv_id":"2312.01701","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.01701","snapshot_observed_at":"2026-08-07T05:43:38.150046Z","title":"Mitigating Fine-Grained Hallucination by Fine-Tuning Large Vision-Language Models with Caption Rewrites","venue":"cs.CV","work_id":"f35a1350-bbcc-4171-b2a0-953d557c87b7","year":2023},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:34.334943Z"},"links":{"cited_paper":"/paper/2312.01701","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:3cf6405375805cfc4b799b98fc1513ebad3a3cd7e913bacbd4f7cb59ef2b0109","observation_id":"d8896fd0-5ed3-4958-be46-b18aed99e8b8","resolution":{"observed_at":"2026-08-07T05:43:38.256527Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T05:43:34.486649Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:34.486649Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:84b8af010d4ab49ef3e1b786e7dc6b8dcb76b7889a46381078cd3671a31df128","observation_id":"62b92993-df73-4df0-a346-5ead6d086bb7","resolution":{"observed_at":"2026-08-07T05:43:34.486649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10529","last_updated":"2024-01-25T04:11:57Z","snapshot_observed_at":"2026-08-08T00:08:56.107140Z","submitted_at":"2024-01-19T07:10:13Z","title":"Mementos: A Comprehensive Benchmark for Multimodal Large Language Model Reasoning over Image Sequences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10529","snapshot_observed_at":"2026-08-07T05:43:34.691445Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:34.691445Z"},"links":{"cited_paper":"/paper/2401.10529","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:5e24fefeaee0a807f87dbaef8e3c24d33aae05ba8fe776a44051c65874585fb7","observation_id":"990122ee-1d85-491e-8966-27c4fad6d45e","resolution":{"observed_at":"2026-08-07T05:43:34.691445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16338","last_updated":"2024-06-24T06:21:59Z","snapshot_observed_at":"2026-08-06T20:31:18.439488Z","submitted_at":"2024-06-24T06:21:59Z","title":"VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16338","snapshot_observed_at":"2026-08-07T05:43:34.855411Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:34.855411Z"},"links":{"cited_paper":"/paper/2406.16338","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:5189b6cd6060a708b6e20def48c433c8ce481f5d36e74586e3536124002ebef2","observation_id":"07f4a18e-c5b7-4a42-880f-b2a1811df3c7","resolution":{"observed_at":"2026-08-07T05:43:34.855411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10900","last_updated":"2024-10-09T03:42:22Z","snapshot_observed_at":"2026-08-08T04:34:36.202690Z","submitted_at":"2024-06-16T11:44:43Z","title":"AutoHallusion: Automatic Generation of Hallucination Benchmarks for Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10900","snapshot_observed_at":"2026-08-07T05:43:35.049938Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:35.049938Z"},"links":{"cited_paper":"/paper/2406.10900","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:cb49cb3877bd824c4e2fae48079ceda64ac7862122f075caef1dcac2f68484dc","observation_id":"cdc4c725-886e-4113-8257-8d1651bade11","resolution":{"observed_at":"2026-08-07T05:43:35.049938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09801","last_updated":"2024-09-23T02:05:02Z","snapshot_observed_at":"2026-07-06T17:30:29.731830Z","submitted_at":"2024-02-15T08:58:03Z","title":"EFUF: Efficient Fine-grained Unlearning Framework for Mitigating Hallucinations in Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09801","snapshot_observed_at":"2026-08-07T05:43:35.177456Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:35.177456Z"},"links":{"cited_paper":"/paper/2402.09801","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:27a51fa983b7d005b483a9c9acc0914e6af9a8c5fa53b567833f9658fb492251","observation_id":"fede79b0-6efd-413c-94bc-753022952baa","resolution":{"observed_at":"2026-08-07T05:43:35.177456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13345","last_updated":"2023-10-20T08:16:46Z","snapshot_observed_at":"2026-08-07T01:43:48.385782Z","submitted_at":"2023-10-20T08:16:46Z","title":"An LLM can Fool Itself: A Prompt-Based Adversarial Attack","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13345","snapshot_observed_at":"2026-08-07T05:43:35.300296Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:35.300296Z"},"links":{"cited_paper":"/paper/2310.13345","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:8d278977605d52f72e16d6a4e2c604c3a5d8cffc8711bc9b8de31e47feae7471","observation_id":"a49bcc17-1f88-4835-9860-f7d9666e8067","resolution":{"observed_at":"2026-08-07T05:43:35.300296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:35.424218Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:35.424218Z"},"links":{"citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:ffe189c23bc6cc127ca9fd4c18730cc339e2ea25687d4fe1e6fe851a3b7fbfe1","observation_id":"734b906b-7b4e-4eb5-b437-7a920adfb3d8","resolution":{"observed_at":"2026-08-07T05:43:35.424218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11271","last_updated":"2024-03-30T22:05:59Z","snapshot_observed_at":"2026-07-06T17:31:33.340510Z","submitted_at":"2024-02-17T13:02:54Z","title":"MONAL: Model Autophagy Analysis for Modeling Human-AI Interactions","version":2},"cited_work":{"arxiv_id":"2402.11271","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11271","snapshot_observed_at":"2026-08-07T05:43:37.717560Z","title":"MONAL: Model Autophagy Analysis for Modeling Human-AI Interactions","venue":"cs.CL","work_id":"638fe302-ab7e-424f-905e-c2cb847bfa23","year":2024},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:35.567212Z"},"links":{"cited_paper":"/paper/2402.11271","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:cd3c2e75aef1e158db0cbdc70d939f6167788453818e04e69ea983e501f8bbeb","observation_id":"f9fd8c2c-f511-4b0f-b0dc-a5b3d1ddb740","resolution":{"observed_at":"2026-08-07T05:43:37.863534Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10863","last_updated":"2025-02-16T22:19:15Z","snapshot_observed_at":"2026-07-06T19:33:16.949210Z","submitted_at":"2024-10-07T21:02:34Z","title":"Exploring the Personality Traits of LLMs through Latent Features Steering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10863","snapshot_observed_at":"2026-08-07T05:43:35.675147Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:35.675147Z"},"links":{"cited_paper":"/paper/2410.10863","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:f871ea1e37302f13e5562cd7cb0ba46687ca2eeda4211e3b34fbbbb4ef20bb1c","observation_id":"d021b2b4-a712-47b4-aace-7117a0e4e00a","resolution":{"observed_at":"2026-08-07T05:43:35.675147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12904","last_updated":"2025-05-26T06:03:03Z","snapshot_observed_at":"2026-08-07T18:08:31.546093Z","submitted_at":"2025-02-18T14:47:02Z","title":"Fraud-R1 : A Multi-Round Benchmark for Assessing the Robustness of LLM Against Augmented Fraud and Phishing Inducements","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12904","snapshot_observed_at":"2026-08-07T05:43:35.808325Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:35.808325Z"},"links":{"cited_paper":"/paper/2502.12904","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:4ceb00031dbd94ef6f6c781ff2a325f621952f8b5297b5486ee0eadfc762fdc4","observation_id":"47c352ea-c9fd-4ec8-aeec-8af44940afda","resolution":{"observed_at":"2026-08-07T05:43:35.808325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-07T05:43:35.925217Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:35.925217Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:a22e98f7192710282ab781b9b56409853d751cc1b1c650b24bfc72da377aba94","observation_id":"31f6c5d9-d4a7-4271-a962-294db7b7e0ed","resolution":{"observed_at":"2026-08-07T05:43:35.925217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:36.083174Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:36.083174Z"},"links":{"citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:9cd1ad18f735aadbf0eeb945020b707da7c6eb88c051a9452e48728b3c4a6f14","observation_id":"79fb8609-18a9-4c14-9b77-cb58c01f6839","resolution":{"observed_at":"2026-08-07T05:43:36.083174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-07T05:43:36.224743Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:36.224743Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:201ba063a690af5f734ba089a9eaf088a9929d7b8c9801e0bf19cfc50bf98402","observation_id":"fdcf0dd1-f827-483f-a986-656c945ec32f","resolution":{"observed_at":"2026-08-07T05:43:36.224743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:43:36.374607Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:36.374607Z"},"links":{"citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:ee039be561a256b43d2b2611246ae2aeaf26b7a2955f50d0f0ddc8d286339ae6","observation_id":"6ea9390e-7259-4111-83c0-5bf82d4df131","resolution":{"observed_at":"2026-08-07T05:43:36.374607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13614","last_updated":"2024-03-25T03:39:45Z","snapshot_observed_at":"2026-07-06T16:51:15.252642Z","submitted_at":"2023-11-22T04:52:58Z","title":"HalluciDoctor: Mitigating Hallucinatory Toxicity in Visual Instruction Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13614","snapshot_observed_at":"2026-08-07T05:43:36.532129Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:36.532129Z"},"links":{"cited_paper":"/paper/2311.13614","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:d385a303bfe21335c1fdbc73e9c736a56cfead0106796c4e49e230d53adff50c","observation_id":"aad50a9c-a2fc-4d9d-96c1-84e7ee15280d","resolution":{"observed_at":"2026-08-07T05:43:36.532129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-07T05:43:36.630082Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:36.630082Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:3597f2b109c66bb043885f88082338cf47fc41ee0a92b81e9417e121ce11ed61","observation_id":"90acff0a-0e30-4c25-b9d7-f482ece61f11","resolution":{"observed_at":"2026-08-07T05:43:36.630082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09022","last_updated":"2025-02-14T05:46:53Z","snapshot_observed_at":"2026-08-08T02:39:29.302698Z","submitted_at":"2025-02-13T07:19:05Z","title":"Mechanistic Unveiling of Transformer Circuits: Self-Influence as a Key to Model Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09022","snapshot_observed_at":"2026-08-07T05:43:36.750878Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:36.750878Z"},"links":{"cited_paper":"/paper/2502.09022","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:04388c11987167e85830e931e3cded0dba05479b19803c3341f9b40772a3ed39","observation_id":"d6158e5e-016c-4ef7-9f1f-8cc880c85cdd","resolution":{"observed_at":"2026-08-07T05:43:36.750878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11919","last_updated":"2024-11-28T13:35:56Z","snapshot_observed_at":"2026-07-06T19:52:11.774784Z","submitted_at":"2024-11-18T04:06:04Z","title":"VL-Uncertainty: Detecting Hallucination in Large Vision-Language Model via Uncertainty Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11919","snapshot_observed_at":"2026-08-07T05:43:36.890342Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:36.890342Z"},"links":{"cited_paper":"/paper/2411.11919","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:eff10884c7f60fe6acb61cbf9b5d592479fdcc96f9650ea862a632f50ebc6899","observation_id":"779e9274-3a55-4091-82cb-427bc5ba9813","resolution":{"observed_at":"2026-08-07T05:43:36.890342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06331","last_updated":"2025-02-01T12:21:59Z","snapshot_observed_at":"2026-08-07T14:11:28.220331Z","submitted_at":"2024-10-08T20:12:11Z","title":"Locate-then-edit for Multi-hop Factual Recall under Knowledge Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06331","snapshot_observed_at":"2026-08-07T05:43:37.084571Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:37.084571Z"},"links":{"cited_paper":"/paper/2410.06331","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:84698bf02ce80b363f2820f0b375b51e06de03f76fd69fa2261279373d071bf4","observation_id":"cf9555ae-8a63-4434-b5b9-f4d4b240c13d","resolution":{"observed_at":"2026-08-07T05:43:37.084571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16839","last_updated":"2024-02-06T16:43:31Z","snapshot_observed_at":"2026-08-08T04:17:23.797697Z","submitted_at":"2023-11-28T14:54:37Z","title":"Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16839","snapshot_observed_at":"2026-08-07T05:43:37.280160Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:37.280160Z"},"links":{"cited_paper":"/paper/2311.16839","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:cebb2e6c7d47b241da37fd5c717b2696de1864613e199c5846c0fe5e77f5bcfb","observation_id":"95852f2b-a7ee-430e-bdd1-418e9e935818","resolution":{"observed_at":"2026-08-07T05:43:37.280160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18476","last_updated":"2024-02-28T16:57:22Z","snapshot_observed_at":"2026-07-06T17:36:56.979448Z","submitted_at":"2024-02-28T16:57:22Z","title":"IBD: Alleviating Hallucinations in Large Vision-Language Models via Image-Biased Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18476","snapshot_observed_at":"2026-08-07T05:43:37.428548Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:37.428548Z"},"links":{"cited_paper":"/paper/2402.18476","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:1021b93a24baf3b15ebb7b1c0debee7ee11653e4ef4908a8caba23a487f25e1a","observation_id":"9d062125-2f2e-4eb7-a33f-543a2fa2dd0a","resolution":{"observed_at":"2026-08-07T05:43:37.428548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2506.07184."}