{"as_of":"2026-08-08T07:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fa81fc85c3a75b73b46ab13898b6df301540d5b3dbb3d81d86ed162213dc577e","coverage":[{"denominator":92,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":92,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T20:32:57.059594Z","state":"measured"},{"denominator":92,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":92,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.08538/citation-record","integrity":"/paper/2509.08538/integrity","json":"/paper/2509.08538/citation-record.json","paper":"/paper/2509.08538"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.355191Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.355191Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:e8802a1dfc995a2cfc4a0bae5c273bebbdc7bc6cc58055ef00d0aebbc770e052","observation_id":"1e356cbf-7a71-4122-b51a-a651befb776a","resolution":{"observed_at":"2026-08-04T20:32:56.355191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.362792Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.362792Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:2cb24b0285b34252c029ca87fe4544390d650299055c0add9ff292892795e5f8","observation_id":"bc4d416f-196f-496d-ac35-4956244fe320","resolution":{"observed_at":"2026-08-04T20:32:56.362792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-04T20:32:56.368080Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.368080Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:37018f9015f56ecfebf710d426f696bb1e2fff8c4d9ab30674406aa4628e15b7","observation_id":"7bbc4ae2-2b48-449f-8b42-69a845ab6de4","resolution":{"observed_at":"2026-08-04T20:32:56.368080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.373710Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.373710Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:c5616f0ca51d003a985483d1065f4c3227e4f47cd07bcbf3423d6d5a74927758","observation_id":"506debf6-d33e-4759-ad25-68f24fa4c7d3","resolution":{"observed_at":"2026-08-04T20:32:56.373710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.385920Z","title":"2020.The visual story: Creating the visual structure of film, TV, and digital media","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.385920Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:36d8ef77c881c6366236f8e974c8014e5c3852ac66ab469e0a5229274cc99d2b","observation_id":"e9e3d4af-39a4-47d7-803e-99950a1b1502","resolution":{"observed_at":"2026-08-04T20:32:56.385920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.393082Z","title":"2005.Figures traced in light: On cinematic staging","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.393082Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:8078ed8ff7dfb33ea287bcd6a85c354be3c21cea1308974f66076c63746bb109","observation_id":"6c802f18-24d5-4edf-b6d1-356ca4c3cd7e","resolution":{"observed_at":"2026-08-04T20:32:56.393082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.399095Z","title":"Bordwell and K","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.399095Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:b34742e06ebed9d6b73fa5fd220e06decf06e2805b76e82988461acb41150791","observation_id":"7c56042b-1401-4670-9243-4994f562161f","resolution":{"observed_at":"2026-08-04T20:32:56.399095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.405345Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.405345Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:87ca50a41636dcab0d3ec5797fa0e434d96253483a6cab111b85604ab3280ccd","observation_id":"48aedb5d-29d7-4710-be97-319161b2aa83","resolution":{"observed_at":"2026-08-04T20:32:56.405345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.413191Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.413191Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:2995cc82f59d2c3ad932fda659068b8757a7cd5eeac8fe59dfe03f3fad78ab36","observation_id":"cd5213d4-144f-4941-a1e6-c02f6c688d28","resolution":{"observed_at":"2026-08-04T20:32:56.413191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.424333Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.424333Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:5fc658331e55a61af83aedaaf5444dbb4eeb18dee9bfa78c127fb346b54b102f","observation_id":"b5c93435-f166-4389-9de1-3406a681970f","resolution":{"observed_at":"2026-08-04T20:32:56.424333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-02T11:10:24.263044Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-04T20:32:56.418696Z","title":"arXiv:2403.17297 [cs.CL]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.418696Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:0876e8a991d2865eccac6219b79f95aefd1ca7dfd5e4c396d49957be139041f6","observation_id":"163f588a-820f-4e44-96dc-363e3f0a1951","resolution":{"observed_at":"2026-08-04T20:32:56.418696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.437988Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.437988Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:76621a0ab70ac00b1671dfb2d35921ac2a7a79f81bd6916712e5b41c4f931918","observation_id":"a75f2100-c4ac-4857-8313-27be9a211d3a","resolution":{"observed_at":"2026-08-04T20:32:56.437988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-04T20:32:56.430841Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.430841Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:f11e04b91d8e5e625faa6f7ca4fdb789806eba0259712aef89cfcf118dbd6171","observation_id":"89a7aa44-fea8-48ec-afbb-113bec72c9a3","resolution":{"observed_at":"2026-08-04T20:32:56.430841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.449752Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.449752Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:2bc719b5befa235eeada8e206ca044d49f21387c23a147f27bc5c5b5d33ed552","observation_id":"c689760a-0b09-4ad3-88ed-e4cb4f398809","resolution":{"observed_at":"2026-08-04T20:32:56.449752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-04T20:32:56.443650Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.443650Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:579ab1a8dc89d19f2666c241467b2e8f220e6301d54d300912c903ac532e3aa7","observation_id":"129077e5-ac55-4b2d-8b39-f1a3bbc40f0a","resolution":{"observed_at":"2026-08-04T20:32:56.443650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.461933Z","title":"2013.Human information processing: Vision, memory, and attention.American Psychological Association","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.461933Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:5e7755999ad74f8971f7186dce166adae43965a1ecf4d936efb9fb2f5be6c367","observation_id":"55d36d7d-628d-4b31-8ccd-196bb6d8b1d3","resolution":{"observed_at":"2026-08-04T20:32:56.461933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16771","last_updated":"2026-04-23T13:21:19Z","snapshot_observed_at":"2026-08-02T03:20:43.405143Z","submitted_at":"2024-11-25T06:17:23Z","title":"VidHal: Benchmarking Temporal Hallucinations in Vision LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16771","snapshot_observed_at":"2026-08-04T20:32:56.455277Z","title":"Kankanhalli","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.455277Z"},"links":{"cited_paper":"/paper/2411.16771","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:684b4e080dde48821f089a734d579a2c10832159d834ff0d8529b5a564898d2e","observation_id":"1ff7a2c9-2aae-46fc-a09c-759ecf7c37ab","resolution":{"observed_at":"2026-08-04T20:32:56.455277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.471710Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.471710Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:411117acd6c2e8ea7aff31fa5e0045eadb6f6949b671bce0f39216325f8fe28f","observation_id":"01e836b6-5343-49bf-8ddc-8e925eb88abb","resolution":{"observed_at":"2026-08-04T20:32:56.471710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.482556Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.482556Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:4150023b2752889decc325bffcd81604da5e3060ba791c190f667e9f4b6aa0a4","observation_id":"c3ba4ab5-7b46-4cf8-a28f-7f50626fb6bf","resolution":{"observed_at":"2026-08-04T20:32:56.482556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07752","last_updated":"2025-03-25T09:46:02Z","snapshot_observed_at":"2026-08-05T14:33:12.627325Z","submitted_at":"2024-10-10T09:28:36Z","title":"Lost in Time: A New Temporal Benchmark for VideoLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07752","snapshot_observed_at":"2026-08-04T20:32:56.477678Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.477678Z"},"links":{"cited_paper":"/paper/2410.07752","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:6351e1a28e89f1fd0d220da9c08f9c532af2aa1e089a011d846969fbc0a6514b","observation_id":"0b62f425-e764-4385-a3c0-7c7e35137384","resolution":{"observed_at":"2026-08-04T20:32:56.477678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.493996Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.493996Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:768bc833b6cca811c63ca7225fe06779f3a33deaee703d51bc0e391686e2d485","observation_id":"5a94453e-fb10-4388-a852-2c8bff38d7bd","resolution":{"observed_at":"2026-08-04T20:32:56.493996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-04T20:32:56.488472Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.488472Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:b57fcbe5d7f7c23b6ae2b80a39e83eeb89ac2eece82fbad02eafe30e3eb9ab41","observation_id":"9b19fdc3-d003-42a6-b2f2-2260e3534d61","resolution":{"observed_at":"2026-08-04T20:32:56.488472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.505747Z","title":"2002.Mise-en-scène: Film style and interpre- tation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.505747Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:c03260293da26add2ba1c7701f0a70307f6f8fbc93e30c451a97b0059c2c91a1","observation_id":"01668f78-84b6-4797-9512-062dda1e2696","resolution":{"observed_at":"2026-08-04T20:32:56.505747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-04T20:32:56.499149Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.499149Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:055129a6286b3d4d96874c258d4d9ca6a1f713f4d9cdb09e6b12c9b025fc5db8","observation_id":"bac15c89-d678-4e26-aca4-202fc2396257","resolution":{"observed_at":"2026-08-04T20:32:56.499149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03905","last_updated":"2023-09-11T20:25:16Z","snapshot_observed_at":"2026-07-06T16:15:50.904062Z","submitted_at":"2023-09-07T17:59:45Z","title":"ImageBind-LLM: Multi-modality Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03905","snapshot_observed_at":"2026-08-04T20:32:56.516191Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.516191Z"},"links":{"cited_paper":"/paper/2309.03905","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:c18bc954e61598e1ba44de7faa1df4fe2cad6a97fa09a8f19836b0daa48fc134","observation_id":"bdf5e9e9-13c3-476d-bb22-a90c3b2bf7e8","resolution":{"observed_at":"2026-08-04T20:32:56.516191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.523017Z","title":null,"venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.523017Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:bd85631dcd444fe08f0c480bc5737987037ecdce9e6d8d0ef36b2b217b3de803","observation_id":"fde065e8-3b2e-42e2-93f2-e98e9cf51af7","resolution":{"observed_at":"2026-08-04T20:32:56.523017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-04T20:32:56.537462Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.537462Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:66dacefa3bcb51c98006d1bdfa09aa42a86655f051e00e02100587dddc12c5d9","observation_id":"985e3870-8e8e-4c16-9e1b-8bf5a67d78e6","resolution":{"observed_at":"2026-08-04T20:32:56.537462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05232","last_updated":"2024-11-19T12:42:45Z","snapshot_observed_at":"2026-07-06T16:45:07.733095Z","submitted_at":"2023-11-09T09:25:37Z","title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05232","snapshot_observed_at":"2026-08-04T20:32:56.532290Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.532290Z"},"links":{"cited_paper":"/paper/2311.05232","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:4a1e62a87fd926f9235e2f4a8ca9bba135331106055d97b24afc38eb8222e2d4","observation_id":"379ccc35-1a65-4357-98b5-e12bd82b8bac","resolution":{"observed_at":"2026-08-04T20:32:56.532290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11150","last_updated":"2024-11-17T18:52:06Z","snapshot_observed_at":"2026-07-06T19:51:37.262377Z","submitted_at":"2024-11-17T18:52:06Z","title":"A Comprehensive Survey on Visual Question Answering Datasets and Algorithms","version":1},"cited_work":{"arxiv_id":"2411.11150","doi":"10.48550/arxiv.2411.11150","metadata_source":"pith","pith_arxiv_id":"2411.11150","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"A Comprehensive Survey on Visual Question Answering Datasets and Algorithms","venue":"cs.CV","work_id":"90985b12-5194-42ce-a23c-c1ca8ba4bfef","year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.548575Z"},"links":{"cited_paper":"/paper/2411.11150","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:a1e75575b698ed4690f584306dc8a23058a9665ff794c786726e36aa72748e98","observation_id":"87382e3c-6127-4ec1-a8b8-a85f99667977","resolution":{"observed_at":"2026-08-04T20:33:54.768847Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.543391Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.543391Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:24c8970bdc79dbf8254e90b74f38b8783fac3c51184ed59d763fd71c7fe3406c","observation_id":"b7e168e3-710a-4620-8786-2f19419ce369","resolution":{"observed_at":"2026-08-04T20:32:56.543391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.563400Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.563400Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:fab916d7813de5cd796ec879f94a2348de42258ff8104d8f2d0c4b59fc18d7df","observation_id":"26f2bd1a-148b-4313-acf8-1c91b77cd277","resolution":{"observed_at":"2026-08-04T20:32:56.563400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.554860Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.554860Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:9b5f6e34192ec6b1071d3f334605ecac1737754d00c57ad97974262e120d7c24","observation_id":"a6efcdce-56d0-46e0-ba0b-dbc53ae73aa1","resolution":{"observed_at":"2026-08-04T20:32:56.554860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-04T20:32:56.574322Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.574322Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:3379b101252415a664a5f75eab2f0cbdcb9d93dab118c516dbee8b0d36ad92ca","observation_id":"d8d35c71-7537-4e24-ad74-7058134d5267","resolution":{"observed_at":"2026-08-04T20:32:56.574322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.567981Z","title":"Berg, and Mohit Bansal","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.567981Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:aa53b8040a59fadf4e4229fab89ccece47a7fb8257b7a2b24f31b86fa7edeb7d","observation_id":"0c100652-0ca4-4266-9173-dd453fb46011","resolution":{"observed_at":"2026-08-04T20:32:56.567981Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-04T20:32:56.586319Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.586319Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:d5352b5ee5b74ee1c21ea25562467e269d16ac6bfd779cc3208a9818daabbc5d","observation_id":"a133ce72-f350-4e46-b0ab-30c9f0976478","resolution":{"observed_at":"2026-08-04T20:32:56.586319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03735","last_updated":"2025-03-31T21:07:49Z","snapshot_observed_at":"2026-07-06T20:01:50.356653Z","submitted_at":"2024-12-04T22:03:19Z","title":"VidHalluc: Evaluating Temporal Hallucinations in Multimodal Large Language Models for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03735","snapshot_observed_at":"2026-08-04T20:32:56.580184Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.580184Z"},"links":{"cited_paper":"/paper/2412.03735","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:f41df8e4d808f9cdfaa4db4c1250ddcb4ba18382c19dc000923734c30fb584fb","observation_id":"6536a079-2501-4bae-aa6f-40347e8612a4","resolution":{"observed_at":"2026-08-04T20:32:56.580184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.597946Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.597946Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:a1661e5b51f6e4a6665283324d5c04a7abd29ad0c49fc20bad6da56da7646c32","observation_id":"e5f377ff-4841-4fa9-a423-5bb7e32e9fdc","resolution":{"observed_at":"2026-08-04T20:32:56.597946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.609106Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.609106Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:ac2cea0d1ca2d55f362901b98be90fe4a752671c13a7757df8c5a8bc97639703","observation_id":"46b695c2-4d8a-437a-b8c4-2b14d639210a","resolution":{"observed_at":"2026-08-04T20:32:56.609106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03246","last_updated":"2024-08-06T15:06:40Z","snapshot_observed_at":"2026-07-06T18:57:31.323769Z","submitted_at":"2024-08-06T15:06:40Z","title":"Making Long-Context Language Models Better Multi-Hop Reasoners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03246","snapshot_observed_at":"2026-08-04T20:32:56.603444Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.603444Z"},"links":{"cited_paper":"/paper/2408.03246","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:736ea658a0e12b01141ecb4890000ed611526b09125984a75615dd7bb49fa12f","observation_id":"ad4666fc-3b11-4d3a-9e02-7d8192d1a559","resolution":{"observed_at":"2026-08-04T20:32:56.603444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-08-04T20:32:56.622377Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.622377Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:df84fe036eee2daf629ee6749e9fe6b66674905d325699073336e0c8af5202b9","observation_id":"1354d313-04a2-4e86-a48a-d63ce58b7a6e","resolution":{"observed_at":"2026-08-04T20:32:56.622377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.615854Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.615854Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:11268b9206caa670f28bd31bc25c53ddffcc24ebce4240452551e0ae0c53b3c0","observation_id":"bb973a2c-59d6-40c4-ace3-c32c41566e5f","resolution":{"observed_at":"2026-08-04T20:32:56.615854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.638414Z","title":"Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Dollár, and C","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.638414Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:12cb1ba1e45172be55681c3e965f5387231d75f7439b7d9898ee359a1b40ddd7","observation_id":"d376f94d-7f43-4ee1-ae00-3a6a48c7a26b","resolution":{"observed_at":"2026-08-04T20:32:56.638414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19773","last_updated":"2023-10-30T17:44:09Z","snapshot_observed_at":"2026-07-06T16:40:39.567420Z","submitted_at":"2023-10-30T17:44:09Z","title":"MM-VID: Advancing Video Understanding with GPT-4V(ision)","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19773","snapshot_observed_at":"2026-08-04T20:32:56.628654Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.628654Z"},"links":{"cited_paper":"/paper/2310.19773","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:78bcbce986f63cdedff24f58756b4d278c51663b82c6dcc964fe7dda1ce0cf03","observation_id":"495627fe-3d36-4200-a04e-5b3679e4326d","resolution":{"observed_at":"2026-08-04T20:32:56.628654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14566","last_updated":"2024-03-25T06:05:24Z","snapshot_observed_at":"2026-08-02T21:20:28.501823Z","submitted_at":"2023-10-23T04:49:09Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14566","snapshot_observed_at":"2026-08-04T20:32:56.656822Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.656822Z"},"links":{"cited_paper":"/paper/2310.14566","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:2c9c9de4869039eeec6ddb0fa6e39702de44a744796046beb7fc003ad286e46b","observation_id":"06da0f1b-aa4f-42fb-8eea-179b37a4ad6f","resolution":{"observed_at":"2026-08-04T20:32:56.656822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.649625Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.649625Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:f010a2c79c47d585b1a061782ae14b9ad03bac5ccfa7df64024c9c08013063c5","observation_id":"f6b3f7e5-12bb-4488-a772-6471d83c52a9","resolution":{"observed_at":"2026-08-04T20:32:56.649625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.670143Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.670143Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:f85ccf55ec9f0001d77fbc4f0fd6c7ea35304f6f182a8b2a9b72945ad53fd8ce","observation_id":"97bd2deb-23c0-4f14-9651-fec031ddc604","resolution":{"observed_at":"2026-08-04T20:32:56.670143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11116","last_updated":"2025-04-14T12:11:51Z","snapshot_observed_at":"2026-08-03T16:32:32.602866Z","submitted_at":"2024-03-17T06:53:44Z","title":"PhD: A ChatGPT-Prompted Visual hallucination Evaluation Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11116","snapshot_observed_at":"2026-08-04T20:32:56.662679Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.662679Z"},"links":{"cited_paper":"/paper/2403.11116","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:c616cf171cdb8c3b8baaa5a2435f9aae4e614095083e3e13ed47c6fe0262096d","observation_id":"8bf8dc53-b87c-4285-bdcf-5ad10395a3ea","resolution":{"observed_at":"2026-08-04T20:32:56.662679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.689614Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.689614Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:0eb1d9b31325b74f6c2468e9db4968d635bc7a981b94314daf4fa7f5cd75ad94","observation_id":"58f373fb-7795-410a-b6db-af1f1b950951","resolution":{"observed_at":"2026-08-04T20:32:56.689614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.676255Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.676255Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:d8050219b20fa7587a05fff1fa3058c2db7c1d828549e8b4ed55247aacd8bd85","observation_id":"fd07ad05-d3d8-4c9c-8428-c674b264f753","resolution":{"observed_at":"2026-08-04T20:32:56.676255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-07-06T19:18:17.523057Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-08-04T20:32:56.684255Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.684255Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:4731709beabf6389acf2218ee81c87cbf9af16e69b1e840be995336bbfa08590","observation_id":"8291684d-8999-4361-96c2-dda099eae3b5","resolution":{"observed_at":"2026-08-04T20:32:56.684255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.708218Z","title":"O’Connor","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.708218Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:7bad92f2cb4f2d616d0e93294ff869248cb53caae147e0f5ceb27cebfea28262","observation_id":"25003f71-9556-4097-860a-2ba84db3ad0d","resolution":{"observed_at":"2026-08-04T20:32:56.708218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03770","last_updated":"2024-05-06T18:09:48Z","snapshot_observed_at":"2026-08-08T03:33:14.622766Z","submitted_at":"2024-05-06T18:09:48Z","title":"Foundation Models for Video Understanding: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03770","snapshot_observed_at":"2026-08-04T20:32:56.695590Z","title":"Rawat, and Thomas B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.695590Z"},"links":{"cited_paper":"/paper/2405.03770","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:d088b602ed81d62c4857b3cf2324a7a37a81ea07cbbaf539a5238daf8a0cdd90","observation_id":"0ee60542-d7c1-4097-af91-440d060e6b87","resolution":{"observed_at":"2026-08-04T20:32:56.695590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.701856Z","title":"2016.From Human Attention to Computational Attention","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.701856Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:14fb0eda2bcbe6b3d2eefd3f0c80b2e432db9cc48206609b59a39cd2fce346eb","observation_id":"2f6e6c7d-485e-4426-acb8-9bdb093bfc71","resolution":{"observed_at":"2026-08-04T20:32:56.701856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findin","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:33:54.361944Z","title":null,"venue":null,"work_id":"59f89d5c-d165-40e9-b62d-4e0165827ed3","year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.726333Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:d1634931361725e664db89d0a965d25d8b960ef21fc1c2bd3e155847e674dd7f","observation_id":"18ffc1c8-dede-49d3-9eb5-78e45b38b78a","resolution":{"observed_at":"2026-08-04T20:33:54.420702Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.714924Z","title":"1999.Foundations of statistical natural language processing","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.714924Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:6decdedd644efcb0451986ff10737bf88315d20bdd0c5bb393067d5a415218dd","observation_id":"a9428a4c-7806-414d-af13-5fe53049cac8","resolution":{"observed_at":"2026-08-04T20:32:56.714924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06196","last_updated":"2025-03-23T14:51:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-09T05:37:09Z","title":"Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06196","snapshot_observed_at":"2026-08-04T20:32:56.719979Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.719979Z"},"links":{"cited_paper":"/paper/2402.06196","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:a29cfc4bc30599bea2dc777cf186d487c4c5406a86648e8cd06fd78e9722da05","observation_id":"0caae250-134e-44c9-b60d-100de4137922","resolution":{"observed_at":"2026-08-04T20:32:56.719979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.753734Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.753734Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:ee52a4207d50a5c094966ff4ee2fd24c7ca997cd880abb98cb3d1a73738aca29","observation_id":"3e437a63-3153-4989-8783-835832e93c72","resolution":{"observed_at":"2026-08-04T20:32:56.753734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16103","last_updated":"2023-11-28T18:16:29Z","snapshot_observed_at":"2026-08-05T15:15:57.768787Z","submitted_at":"2023-11-27T18:59:58Z","title":"Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16103","snapshot_observed_at":"2026-08-04T20:32:56.736581Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.736581Z"},"links":{"cited_paper":"/paper/2311.16103","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:9eb0b8504133ff8720fd3755069e2fbdad4a69eb46a972d709c78ff98430308b","observation_id":"21a2c4cd-3046-4363-94bf-87e42334fa85","resolution":{"observed_at":"2026-08-04T20:32:56.736581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-04T20:32:56.744472Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.744472Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:f410d844f7319593d1d1e4a99e6a1547c93a1b96a5e28b9bfcfca4295ba05b14","observation_id":"cf239a5f-b4c5-488b-84dd-7fca0def9139","resolution":{"observed_at":"2026-08-04T20:32:56.744472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.787102Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.787102Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:6f1ad4431b4c1932e291042848f6863226a0b6e58b698bee6b5edc67115a4c76","observation_id":"4fad3c1e-f926-404a-96d2-75968684131d","resolution":{"observed_at":"2026-08-04T20:32:56.787102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.761348Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.761348Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:cb527c4e4320faed4e1838d5cefd46e0328bd2e00b20f24cb3f171b11c364a3b","observation_id":"d2e64a15-bf18-4644-86c8-68f0a76d935e","resolution":{"observed_at":"2026-08-04T20:32:56.761348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.771366Z","title":"Girshick, and Ali Farhadi","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.771366Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:5a8b294315e5dc5c1d905bf762a2fa4977e2cc4a174af04ad31e4a31cf879770","observation_id":"52cab061-e964-47fb-af3e-dff4cd902496","resolution":{"observed_at":"2026-08-04T20:32:56.771366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10889","last_updated":"2025-03-30T14:07:22Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T10:42:21Z","title":"VELOCITI: Benchmarking Video-Language Compositional Reasoning with Strict Entailment","version":2},"cited_work":{"arxiv_id":"2406.10889","doi":"10.48550/arxiv.2406.10889","metadata_source":"pith","pith_arxiv_id":"2406.10889","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VELOCITI: Benchmarking Video-Language Compositional Reasoning with Strict Entailment","venue":"cs.CV","work_id":"d985b995-702b-44d9-9455-68e82e976ac1","year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.811561Z"},"links":{"cited_paper":"/paper/2406.10889","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:f6b2c95ae81cc61c1c196777ae8f27d0ab6118a47a2b3bf1fdbc7fdbe576bf00","observation_id":"48ab59c9-9d8a-4f19-843d-204ab322525c","resolution":{"observed_at":"2026-08-04T20:33:54.254429Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14485","last_updated":"2024-12-10T12:45:31Z","snapshot_observed_at":"2026-07-06T19:19:28.953455Z","submitted_at":"2024-09-22T15:13:31Z","title":"Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14485","snapshot_observed_at":"2026-08-04T20:32:56.818052Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.818052Z"},"links":{"cited_paper":"/paper/2409.14485","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:a98593f5ec7269f0f55f8fa46e1852ecf7ed4ca14985d7dd303ff18e8095c665","observation_id":"b7efc35b-e33d-4610-9fea-8e2297ab618c","resolution":{"observed_at":"2026-08-04T20:32:56.818052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.791245Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.791245Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:c955ae1b1e34f6655dd239a2c2eb6241b88e74f6bb7f5b081c4804222fd06f98","observation_id":"8502143b-8ff9-4926-ac1c-d057501e47a2","resolution":{"observed_at":"2026-08-04T20:32:56.791245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09589","last_updated":"2024-10-03T09:00:35Z","snapshot_observed_at":"2026-07-06T18:14:54.506051Z","submitted_at":"2024-05-15T10:16:25Z","title":"A Comprehensive Survey of Hallucination in Large Language, Image, Video and Audio Foundation Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09589","snapshot_observed_at":"2026-08-04T20:32:56.800975Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.800975Z"},"links":{"cited_paper":"/paper/2405.09589","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:10262d57a90f92f191fe3dd8f71156facb5ca7c3f0ca85ee7f543e64b067e5ce","observation_id":"cd7a7a2f-5127-4713-9ec0-14b0dc18d603","resolution":{"observed_at":"2026-08-04T20:32:56.800975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.860424Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.860424Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:c68403394c256eae5bd6fdbd118513794ed14396c5ddf31ddb69303cbb01fe9e","observation_id":"ba898d62-0a29-4e56-8bf4-2fa5ddf24e8e","resolution":{"observed_at":"2026-08-04T20:32:56.860424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.881841Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.881841Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:81af66c9caae16bf2f0cc420319f44126cbe0ed9c99775309b30b7aaa5899662","observation_id":"2a774b62-1def-48a4-8bf3-6a5b37fdb8cb","resolution":{"observed_at":"2026-08-04T20:32:56.881841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-04T20:32:56.838540Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.838540Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:2bbaff1a44635484994858e0624f9091dcef6708405a622f3da65a999b5fdaa2","observation_id":"fd36a8e4-b0fc-46e9-98bf-99b284787fc0","resolution":{"observed_at":"2026-08-04T20:32:56.838540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-04T20:32:56.919983Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.919983Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:487cdd9c4f5ee108cbee86d8d8c4fbf9ec34450787100b07d1c195c68c20313b","observation_id":"18729337-7b79-43b7-ae5b-c8c879c8914c","resolution":{"observed_at":"2026-08-04T20:32:56.919983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.929596Z","title":"2013.The Oxford handbook of sound and image in digital media","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.929596Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:f96c8d200127b522ba5720dbfdba08712eb239f619481586fbf0d69c73c062cd","observation_id":"a0306755-04af-44b5-b69f-1995e547ec4a","resolution":{"observed_at":"2026-08-04T20:32:56.929596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-04T20:32:56.938002Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.938002Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:5c6bec7a91fc9667a22bbc429fecf535ea909a1ee6fc038294671b36d00ff42e","observation_id":"a0173072-d145-4abc-903e-ca8a286a69e4","resolution":{"observed_at":"2026-08-04T20:32:56.938002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-04T20:32:56.907053Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.907053Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:56d702b074c6aff270d8e50338ea6e935499560628c1076ff617d3781c90557d","observation_id":"0c613ce5-c7c3-4050-9a71-e8656ada9263","resolution":{"observed_at":"2026-08-04T20:32:56.907053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.914794Z","title":"2009.Multimodal Sig- nal Processing: Theory and applications for human-computer interaction","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.914794Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:804577022bb1ad3e6a7f67f139aac92266a8dee033d3f5a2d5577dc6228d7e81","observation_id":"fd98d0cf-6b39-4998-a054-ef3e5fcfe619","resolution":{"observed_at":"2026-08-04T20:32:56.914794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09613","last_updated":"2024-12-12T18:59:40Z","snapshot_observed_at":"2026-08-01T15:11:43.922290Z","submitted_at":"2024-12-12T18:59:40Z","title":"PVC: Progressive Visual Token Compression for Unified Image and Video Processing in Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09613","snapshot_observed_at":"2026-08-04T20:32:56.967932Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.967932Z"},"links":{"cited_paper":"/paper/2412.09613","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:16634bf883ad7f2f955020c2510b904867f3f4bd8fba36bc499793520b9d7df9","observation_id":"a55a2557-5730-4d44-8d43-a7dfa88ea0b1","resolution":{"observed_at":"2026-08-04T20:32:56.967932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06040","last_updated":"2024-10-25T06:32:09Z","snapshot_observed_at":"2026-07-06T18:27:58.433967Z","submitted_at":"2024-06-10T06:17:55Z","title":"Vript: A Video Is Worth Thousands of Words","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06040","snapshot_observed_at":"2026-08-04T20:32:56.975944Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.975944Z"},"links":{"cited_paper":"/paper/2406.06040","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:d37a5a45f003854f40c3c5c2ac0cfe2de106ad11d06f338775fb7653f2d21901","observation_id":"a1cf3dde-b5ac-47fb-af1c-7cd6dcf65ebe","resolution":{"observed_at":"2026-08-04T20:32:56.975944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-04T20:32:56.981480Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.981480Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:5bcb326a2b77faceee60b95ff588d9a961f992f6061ae6ecadb901d12d66fb0b","observation_id":"b4a199f5-70ff-4355-8060-0d6ce4e43a0d","resolution":{"observed_at":"2026-08-04T20:32:56.981480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.945883Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.945883Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:5147fb7ea27ee3ae63651495ca61a8c5af546750035fe1e0b32afe876bbebc87","observation_id":"fbe2bbd1-7f04-4423-aaf0-1df9d433dd98","resolution":{"observed_at":"2026-08-04T20:32:56.945883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16338","last_updated":"2024-06-24T06:21:59Z","snapshot_observed_at":"2026-08-06T20:31:18.439488Z","submitted_at":"2024-06-24T06:21:59Z","title":"VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16338","snapshot_observed_at":"2026-08-04T20:32:56.952259Z","title":"arXiv:2406.16338 doi:10","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.952259Z"},"links":{"cited_paper":"/paper/2406.16338","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:efda25a78f293428eaed406122051d4edd62a0fbb9a7b11e8bcb2a673b9def24","observation_id":"14760259-ed39-4b68-b20a-974d045ae3cb","resolution":{"observed_at":"2026-08-04T20:32:56.952259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-04T20:32:56.960144Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.960144Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:be2060fe6fb96aec6ebf27a7c662840c0b11b1f82ea42916d9f7a91e20136b22","observation_id":"13186908-81bf-4add-9d15-bf2d0dd2677d","resolution":{"observed_at":"2026-08-04T20:32:56.960144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-04T20:32:57.016518Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:57.016518Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:6f324835dcdba1661291c78df07b22c6a47fc4cd58711c03b34e564dc606b187","observation_id":"cc89babc-b975-4d58-9f7b-b9b38196ef01","resolution":{"observed_at":"2026-08-04T20:32:57.016518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18659","last_updated":"2025-07-31T07:54:00Z","snapshot_observed_at":"2026-07-06T19:58:09.591787Z","submitted_at":"2024-11-27T09:43:09Z","title":"DHCP: Detecting Hallucinations by Cross-modal Attention Pattern in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18659","snapshot_observed_at":"2026-08-04T20:32:57.027292Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:57.027292Z"},"links":{"cited_paper":"/paper/2411.18659","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:f3110e56051f2e736b49750c4cfdf8380b82086b7574d8fe2a781f83753f9245","observation_id":"96c2936d-b272-44d5-a83f-ba6c9623791d","resolution":{"observed_at":"2026-08-04T20:32:57.027292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-04T20:32:57.038704Z","title":"A man wearing long-sleeved collared pink button-up shirt with pockets and not wearing glasses appears in the video","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:57.038704Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:d8ae81a6791acf9a10c747a91e0301ea497d4a8fc0850ac58dc15ed8b9d24ea0","observation_id":"9f0fd19d-6798-437b-a629-a7d532ad0a5c","resolution":{"observed_at":"2026-08-04T20:32:57.038704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.987009Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.987009Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:08c39f0c6846ab1be9a56a0bb730206ee1baf9be7d4cce6a75e18b26173c7b58","observation_id":"288f0ac9-7ebe-4473-9e8d-6d6f16129ce4","resolution":{"observed_at":"2026-08-04T20:32:56.987009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.994039Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.994039Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:cd39d0b12f02696bb9640bbf0526c63ea0f78d83efc999e873922e23fb8d0eaa","observation_id":"25887e44-7304-4c90-8082-a4d8b91cef5f","resolution":{"observed_at":"2026-08-04T20:32:56.994039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:57.000075Z","title":"arXiv:2409.16597 doi:10.48550/ARXIV.2409.16597","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:57.000075Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:4e5fb082a1196a479fd060a64b595c0a7b8188b3c4f4f099af7c6bb82b67b414","observation_id":"3b0cb272-5819-462f-a3d7-d55ee8d43571","resolution":{"observed_at":"2026-08-04T20:32:57.000075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:57.007950Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:57.007950Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:a5972ddd8ca6f547c7bdc58eb6d7a63efe1b74f61b0651ba334669e9ba708cb6","observation_id":"78f725de-5138-4e5d-8427-d6f0628d5ddb","resolution":{"observed_at":"2026-08-04T20:32:57.007950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:57.050146Z","title":null,"venue":null,"work_id":null,"year":1939},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:57.050146Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:eccddc236ec093e8b9bd627a6ccca28479efcc360e4830ac505ccad51bc0f6e3","observation_id":"2999ef6d-299e-4698-8d5e-77d45e0f5f99","resolution":{"observed_at":"2026-08-04T20:32:57.050146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:57.059594Z","title":"(00:38 – 00:46) (CIV) Q: Which individual was the one who spoke in the video? Options: A: A man in a white vest was speaking in the video","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:57.059594Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:68d4505ac8306d4fa23126188b1b2cf3e36f9aaba3a3710d74414be83a1122f2","observation_id":"fea97aaa-4d6d-47aa-b7ce-35c4e290a4f6","resolution":{"observed_at":"2026-08-04T20:32:57.059594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.778550Z","title":"In2016 IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2016, Las Vegas, NV, USA, June 27-30, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.778550Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:8c9b51aeb9584b5c9d8cd017b563e26dc48cb23c44c01ee80c3bb082f5926be4","observation_id":"7303eb7a-f8ea-4545-a508-6cda5b5daacb","resolution":{"observed_at":"2026-08-04T20:32:56.778550Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.895347Z","title":"arXiv:2312.17432 doi:10.48550/ARXIV.2312.17432","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.895347Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:d723d4224dc8b6f3fde59e7faf24cd543996edd7b24c9bba77fa0641f9abc614","observation_id":"7c1dc52b-a6f6-401a-90ea-ad035364cf8f","resolution":{"observed_at":"2026-08-04T20:32:56.895347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:32:56.379260Z","title":"In IEEE/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2024, Seattle, W A, USA, June 16-22, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T20:32:56.379260Z"},"links":{"citing_paper":"/paper/2509.08538"},"observation_digest":"sha256:9a8d9cd94d2fb12147d66298c2edcbf797e9ada9fc3dabd2745adced07bb4f63","observation_id":"1f7800d9-7adc-415d-b298-9ecdd297d6bf","resolution":{"observed_at":"2026-08-04T20:32:56.379260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.08538","last_updated":"2025-09-11T11:14:00Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T04:48:45.855809Z","submitted_at":"2025-09-10T12:34:07Z","title":"MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models"},"reference_resolution":{"displayed":92,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":87,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":92},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 92 of 92 outbound references and 0 inbound Pith citation observations for arXiv:2509.08538."}