{"as_of":"2026-08-18T22:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b39634414937b9e33247d8a98f069d9d047da21bff3778ef20fcea14483dc493","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T06:36:26.484082Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T02:31:40.463891Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T07:36:31.820599Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.22574","last_updated":"2026-06-05T06:23:47Z","snapshot_observed_at":"2026-08-15T07:55:53.363774Z","submitted_at":"2026-01-30T05:16:12Z","title":"Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2601.22574","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.22574","snapshot_observed_at":"2026-06-08T02:03:50.869564Z","title":"Mitigating hallucinations in video large language models via spatiotemporal-semantic contrastive decoding","venue":null,"work_id":"80138c02-75c7-4281-a7c6-73724d3514ca","year":2026},"citing_paper":{"arxiv_id":"2605.08974","last_updated":"2026-08-15T02:58:01Z","snapshot_observed_at":"2026-08-18T21:12:56.514920Z","submitted_at":"2026-05-09T14:32:36Z","title":"Tracking the Truth: Object-Centric Spatio-Temporal Monitoring for Video Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T02:31:40.463891Z"},"links":{"cited_paper":"/paper/2601.22574","citing_paper":"/paper/2605.08974"},"observation_digest":"sha256:68d8c3732a9af0e7b7e18df6e388f0f2633d2016198d9f76771c33e5aa796a67","observation_id":"a41e6d9f-3019-400d-b960-51b86cea64b0","resolution":{"observed_at":"2026-06-08T02:03:50.869564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2601.22574/citation-record","integrity":"/paper/2601.22574/integrity","json":"/paper/2601.22574/citation-record.json","paper":"/paper/2601.22574"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:25.276084Z","title":"Grounding language with vision: A conditional mutual information calibrated decoding strat- egy for reducing hallucinations in lvlms.arXiv preprint arXiv:2505.19678,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22574","last_updated":"2026-06-05T06:23:47Z","snapshot_observed_at":"2026-08-15T07:55:53.363774Z","submitted_at":"2026-01-30T05:16:12Z","title":"Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:25.276084Z"},"links":{"citing_paper":"/paper/2601.22574"},"observation_digest":"sha256:57bd19576ef986605ce6ac79af7880c8b62364b24e2a3b814c1ba13e641dd8ab","observation_id":"9eef630c-9d12-4349-937f-3ceb8eba3994","resolution":{"observed_at":"2026-08-03T06:36:25.276084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19622","last_updated":"2025-03-25T13:12:17Z","snapshot_observed_at":"2026-08-18T02:56:20.086117Z","submitted_at":"2025-03-25T13:12:17Z","title":"Exploring Hallucination of Large Multimodal Models in Video Understanding: Benchmark, Analysis and Mitigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19622","snapshot_observed_at":"2026-08-03T06:36:25.319744Z","title":"Exploring hallucination of large multimodal models in video understanding: Benchmark, analysis and mitigation.arXiv preprint arXiv:2503.19622, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22574","last_updated":"2026-06-05T06:23:47Z","snapshot_observed_at":"2026-08-15T07:55:53.363774Z","submitted_at":"2026-01-30T05:16:12Z","title":"Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:25.319744Z"},"links":{"cited_paper":"/paper/2503.19622","citing_paper":"/paper/2601.22574"},"observation_digest":"sha256:a647f0b0ff6f18f31cff38b6f712d98aff1c6862bc15a3affefbdd37c44ee2b8","observation_id":"47c1b3e6-57a4-4dab-94d9-c39b6b685622","resolution":{"observed_at":"2026-08-03T06:36:25.319744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:25.378480Z","title":"Mentalmac: Enhancing large language models for detect- ing mental manipulation via multi-task anti-curriculum distillation.arXiv preprint arXiv:2505.15255, 2025b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22574","last_updated":"2026-06-05T06:23:47Z","snapshot_observed_at":"2026-08-15T07:55:53.363774Z","submitted_at":"2026-01-30T05:16:12Z","title":"Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:25.378480Z"},"links":{"citing_paper":"/paper/2601.22574"},"observation_digest":"sha256:e5ba2255031539b02cd8a4f893263d0843ea829354d0e9994fce044a7c6e4e86","observation_id":"f68a30ba-060e-45b2-8058-16df557cbff3","resolution":{"observed_at":"2026-08-03T06:36:25.378480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13122","last_updated":"2025-04-17T17:39:41Z","snapshot_observed_at":"2026-08-17T12:45:16.433408Z","submitted_at":"2025-04-17T17:39:41Z","title":"VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13122","snapshot_observed_at":"2026-08-03T06:36:25.474447Z","title":"Vistadpo: Video hierarchical spatial-temporal direct preference optimization for large video models.arXiv preprint arXiv:2504.13122,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22574","last_updated":"2026-06-05T06:23:47Z","snapshot_observed_at":"2026-08-15T07:55:53.363774Z","submitted_at":"2026-01-30T05:16:12Z","title":"Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:25.474447Z"},"links":{"cited_paper":"/paper/2504.13122","citing_paper":"/paper/2601.22574"},"observation_digest":"sha256:b6abc71a2321ff3d21a82b2a7b67ba22cac4f929a12eadc406b369a20870222f","observation_id":"41f780d3-8f56-4fd1-b112-2ccb19bdf0e7","resolution":{"observed_at":"2026-08-03T06:36:25.474447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:25.569043Z","title":"H., Jo, Y ., and Seo, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22574","last_updated":"2026-06-05T06:23:47Z","snapshot_observed_at":"2026-08-15T07:55:53.363774Z","submitted_at":"2026-01-30T05:16:12Z","title":"Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:25.569043Z"},"links":{"citing_paper":"/paper/2601.22574"},"observation_digest":"sha256:6f7dc029db5dcbbd53bc07d0450ab3ccdb05b137dde2daca52a5d0344143b4be","observation_id":"bd967670-d41d-46f1-b8f7-289c78e505c0","resolution":{"observed_at":"2026-08-03T06:36:25.569043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-03T06:36:25.779451Z","title":"Mitigating hallucination in large multi-modal models via robust instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22574","last_updated":"2026-06-05T06:23:47Z","snapshot_observed_at":"2026-08-15T07:55:53.363774Z","submitted_at":"2026-01-30T05:16:12Z","title":"Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:25.779451Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2601.22574"},"observation_digest":"sha256:e4b8ee88b04ac027cdbeb0167c49e56458cea359be12f00c1a0828e08fa08087","observation_id":"d5808543-5658-4a0d-a05f-415c4feb81f9","resolution":{"observed_at":"2026-08-03T06:36:25.779451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:25.834881Z","title":"Countervid: Counterfactual video generation for mitigat- ing action and temporal hallucinations in video-language models.arXiv preprint arXiv:2601.04778,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22574","last_updated":"2026-06-05T06:23:47Z","snapshot_observed_at":"2026-08-15T07:55:53.363774Z","submitted_at":"2026-01-30T05:16:12Z","title":"Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:25.834881Z"},"links":{"citing_paper":"/paper/2601.22574"},"observation_digest":"sha256:b56a14aa85a5fcac564159262e46cfc608259ab2b80714b44977fd67fea9192f","observation_id":"da3e0954-924c-4902-80ea-91d18c307674","resolution":{"observed_at":"2026-08-03T06:36:25.834881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:25.911702Z","title":"Smart- sight: Mitigating hallucination in video-llms without com- promising video understanding via temporal attention collapse.arXiv preprint arXiv:2512.18671,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22574","last_updated":"2026-06-05T06:23:47Z","snapshot_observed_at":"2026-08-15T07:55:53.363774Z","submitted_at":"2026-01-30T05:16:12Z","title":"Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:25.911702Z"},"links":{"citing_paper":"/paper/2601.22574"},"observation_digest":"sha256:59e1720b7771da0182113f1bfb39ed38d3f6e5c3f97da621eecd03f4f2a02970","observation_id":"4de1f7b8-f60c-4ef0-a021-b1bbfe3febcc","resolution":{"observed_at":"2026-08-03T06:36:25.911702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16338","last_updated":"2024-06-24T06:21:59Z","snapshot_observed_at":"2026-08-18T08:00:43.892091Z","submitted_at":"2024-06-24T06:21:59Z","title":"VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16338","snapshot_observed_at":"2026-08-03T06:36:26.055855Z","title":"Videohallucer: Evaluating intrinsic and extrinsic halluci- nations in large video-language models.arXiv preprint arXiv:2406.16338,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22574","last_updated":"2026-06-05T06:23:47Z","snapshot_observed_at":"2026-08-15T07:55:53.363774Z","submitted_at":"2026-01-30T05:16:12Z","title":"Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:26.055855Z"},"links":{"cited_paper":"/paper/2406.16338","citing_paper":"/paper/2601.22574"},"observation_digest":"sha256:38bb95d9d60d2928f77214e57fd9b548aced6ec05e94c9801e001cab5cf38a15","observation_id":"d80fcd96-959f-4a72-9985-1e19fcb2a6e0","resolution":{"observed_at":"2026-08-03T06:36:26.055855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:26.108846Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22574","last_updated":"2026-06-05T06:23:47Z","snapshot_observed_at":"2026-08-15T07:55:53.363774Z","submitted_at":"2026-01-30T05:16:12Z","title":"Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:26.108846Z"},"links":{"citing_paper":"/paper/2601.22574"},"observation_digest":"sha256:cca22cabf4dee27def9d5db403946e7e9e7a25e397764c302fb80fd283731414","observation_id":"4183cc5b-88aa-481a-af8f-b4baa078a506","resolution":{"observed_at":"2026-08-03T06:36:26.108846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:26.211914Z","title":"Kardia-r1: Unleashing llms to reason to- ward understanding and empathy for emotional support via rubric-as-judge reinforcement learning.arXiv preprint arXiv:2512.01282, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22574","last_updated":"2026-06-05T06:23:47Z","snapshot_observed_at":"2026-08-15T07:55:53.363774Z","submitted_at":"2026-01-30T05:16:12Z","title":"Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:26.211914Z"},"links":{"citing_paper":"/paper/2601.22574"},"observation_digest":"sha256:35990e8f4866e5f5b19b0c6e156c91059dcd5f12e32aa32d7a40c6de097c8d75","observation_id":"9498603f-c74d-4438-8ebf-1b6bc3972838","resolution":{"observed_at":"2026-08-03T06:36:26.211914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:26.275069Z","title":"Video-llama: An instruction- tuned audio-visual language model for video understand- ing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22574","last_updated":"2026-06-05T06:23:47Z","snapshot_observed_at":"2026-08-15T07:55:53.363774Z","submitted_at":"2026-01-30T05:16:12Z","title":"Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:26.275069Z"},"links":{"citing_paper":"/paper/2601.22574"},"observation_digest":"sha256:0aeff452e2839cd62915d29e331af21f63fa455e214cd0c7ba65f3e7916709c1","observation_id":"d5c1c029-6c75-436f-b0b4-16d7c869f433","resolution":{"observed_at":"2026-08-03T06:36:26.275069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:26.315860Z","title":"Eventhallusion: Diagnosing event hallucinations in video llms.arXiv preprint arXiv:2409.16597, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22574","last_updated":"2026-06-05T06:23:47Z","snapshot_observed_at":"2026-08-15T07:55:53.363774Z","submitted_at":"2026-01-30T05:16:12Z","title":"Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:26.315860Z"},"links":{"citing_paper":"/paper/2601.22574"},"observation_digest":"sha256:664247d37184880204ef8c462e1bf298a9efbeb91c78dd664317199e4e6e6f58","observation_id":"96dd6031-5c4b-4cab-a7c0-83252aa71abb","resolution":{"observed_at":"2026-08-03T06:36:26.315860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:26.367685Z","title":"j., Gui, L., Fu, D., Feng, J., Liu, Z., and Li, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22574","last_updated":"2026-06-05T06:23:47Z","snapshot_observed_at":"2026-08-15T07:55:53.363774Z","submitted_at":"2026-01-30T05:16:12Z","title":"Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:26.367685Z"},"links":{"citing_paper":"/paper/2601.22574"},"observation_digest":"sha256:eff4d5235bb69c1d70bc625666e826a646e2d4e535e5a6bd28a95b808f7d3871","observation_id":"237834a3-6d1f-41ef-9563-5d0b483f3496","resolution":{"observed_at":"2026-08-03T06:36:26.367685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:26.425417Z","title":"Can pruning improve reasoning? revisiting long-cot compression with capability in mind for better reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22574","last_updated":"2026-06-05T06:23:47Z","snapshot_observed_at":"2026-08-15T07:55:53.363774Z","submitted_at":"2026-01-30T05:16:12Z","title":"Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:26.425417Z"},"links":{"citing_paper":"/paper/2601.22574"},"observation_digest":"sha256:4dd4955cd74c6e59edc63507d01af4366cfe9b549effeb0ca8fd834dc2276759","observation_id":"659eaaf6-511a-473d-9f5c-9b76a50e4198","resolution":{"observed_at":"2026-08-03T06:36:26.425417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:26.484082Z","title":"Layernorm Linear GeLU Linear GeLU Linear Tanh Layernorm Linear GeLU Linear GeLU Linear Tanh Figure 6.Overview of the architecture of SSD","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22574","last_updated":"2026-06-05T06:23:47Z","snapshot_observed_at":"2026-08-15T07:55:53.363774Z","submitted_at":"2026-01-30T05:16:12Z","title":"Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:26.484082Z"},"links":{"citing_paper":"/paper/2601.22574"},"observation_digest":"sha256:daf3301446957999e881faa51c3a52617a28dcd30052d6de745257365d7ae203","observation_id":"5e077945-d7b4-47c6-84b1-e83c05dd89c0","resolution":{"observed_at":"2026-08-03T06:36:26.484082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06206","last_updated":"2026-05-20T06:11:17Z","snapshot_observed_at":"2026-08-03T23:16:24.148750Z","submitted_at":"2025-08-08T10:39:04Z","title":"Affordance-R1: Reinforcement Learning for Generalizable Affordance Reasoning in Multimodal Large Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06206","snapshot_observed_at":"2026-08-03T06:36:25.992400Z","title":"Affordance- r1: Reinforcement learning for generalizable affordance reasoning in multimodal large language model.arXiv preprint arXiv:2508.06206,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22574","last_updated":"2026-06-05T06:23:47Z","snapshot_observed_at":"2026-08-15T07:55:53.363774Z","submitted_at":"2026-01-30T05:16:12Z","title":"Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:25.992400Z"},"links":{"cited_paper":"/paper/2508.06206","citing_paper":"/paper/2601.22574"},"observation_digest":"sha256:a6666d3ed6c270a679caf8bab8d71cc0e0dc1ca4b2046020ad13c84bf34426ec","observation_id":"b7b21c44-bcda-46b7-982c-d67aab7717c5","resolution":{"observed_at":"2026-08-03T06:36:25.992400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:26.165448Z","title":"Helpd: Mitigating hallucination of lvlms by hierarchical feedback learning with vision-enhanced penalty decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22574","last_updated":"2026-06-05T06:23:47Z","snapshot_observed_at":"2026-08-15T07:55:53.363774Z","submitted_at":"2026-01-30T05:16:12Z","title":"Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:26.165448Z"},"links":{"citing_paper":"/paper/2601.22574"},"observation_digest":"sha256:39e26c3338c77fc18bda692768cfc42f58ece929643028294c3f2b75b8fc8c1c","observation_id":"0a6763e4-2535-425b-9843-2594ba84dcf7","resolution":{"observed_at":"2026-08-03T06:36:26.165448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:25.694297Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22574","last_updated":"2026-06-05T06:23:47Z","snapshot_observed_at":"2026-08-15T07:55:53.363774Z","submitted_at":"2026-01-30T05:16:12Z","title":"Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:25.694297Z"},"links":{"citing_paper":"/paper/2601.22574"},"observation_digest":"sha256:f7b36c81fb234c7ceb1dbf7e29b288cab8a9740af6261c4f5c3ff5cb7ddd43b3","observation_id":"79c897ce-3b31-45da-9dc2-7ccd05ab297e","resolution":{"observed_at":"2026-08-03T06:36:25.694297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12826","last_updated":"2025-05-19T08:12:06Z","snapshot_observed_at":"2026-08-18T08:00:56.071409Z","submitted_at":"2025-05-19T08:12:06Z","title":"Mitigating Hallucination in VideoLLMs via Temporal-Aware Activation Engineering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12826","snapshot_observed_at":"2026-08-03T06:36:25.124649Z","title":"Mitigating hallucination in videollms via temporal-aware activation engineering.arXiv preprint arXiv:2505.12826,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22574","last_updated":"2026-06-05T06:23:47Z","snapshot_observed_at":"2026-08-15T07:55:53.363774Z","submitted_at":"2026-01-30T05:16:12Z","title":"Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:25.124649Z"},"links":{"cited_paper":"/paper/2505.12826","citing_paper":"/paper/2601.22574"},"observation_digest":"sha256:6e53bbf2703d624a5d5ef4c66dc504a756b3b57c4f27547705618e81631509b4","observation_id":"ddf08541-6493-4209-b923-2632e50ca56d","resolution":{"observed_at":"2026-08-03T06:36:25.124649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:25.182617Z","title":"Decoupling contrastive decoding: Robust hallucination mitigation in multimodal large language models.arXiv preprint arXiv:2504.08809,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22574","last_updated":"2026-06-05T06:23:47Z","snapshot_observed_at":"2026-08-15T07:55:53.363774Z","submitted_at":"2026-01-30T05:16:12Z","title":"Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:25.182617Z"},"links":{"citing_paper":"/paper/2601.22574"},"observation_digest":"sha256:4eb17cbb186b848a95a87762e323e4ded4b036cc016b9212f4610f7313bc38f1","observation_id":"8f265e5e-95f3-4a29-a098-211c1d0d2a1c","resolution":{"observed_at":"2026-08-03T06:36:25.182617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05810","last_updated":"2025-04-15T07:20:46Z","snapshot_observed_at":"2026-08-18T21:41:28.266944Z","submitted_at":"2025-04-08T08:41:41Z","title":"PaMi-VDPO: Mitigating Video Hallucinations by Prompt-Aware Multi-Instance Video Preference Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05810","snapshot_observed_at":"2026-08-03T06:36:25.228855Z","title":"Pami-vdpo: Mitigating video hallucinations by prompt- aware multi-instance video preference learning.arXiv preprint arXiv:2504.05810,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22574","last_updated":"2026-06-05T06:23:47Z","snapshot_observed_at":"2026-08-15T07:55:53.363774Z","submitted_at":"2026-01-30T05:16:12Z","title":"Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:25.228855Z"},"links":{"cited_paper":"/paper/2504.05810","citing_paper":"/paper/2601.22574"},"observation_digest":"sha256:ee19c08f9492a2d7f4352ba3c4005e9bc63995d794842e595fd5f2215d88ca0c","observation_id":"3c5176a0-b158-44a3-b733-7f69cc794a5b","resolution":{"observed_at":"2026-08-03T06:36:25.228855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.22574","last_updated":"2026-06-05T06:23:47Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T07:55:53.363774Z","submitted_at":"2026-01-30T05:16:12Z","title":"Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 1 inbound Pith citation observation for arXiv:2601.22574."}