{"as_of":"2026-08-13T07:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:00732afb7ae77defd912d9e61891aac228f23a9b2abb06297b06d0538cd64068","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:32:24.293670Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.11906/citation-record","integrity":"/paper/2412.11906/integrity","json":"/paper/2412.11906/citation-record.json","paper":"/paper/2412.11906"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:23.961398Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:23.961398Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:8540eb71029d2528f487cba5736820b1e0c4b75afeb420f178c19989ed22593d","observation_id":"5cf7f770-e143-4ac4-8619-7f993312b476","resolution":{"observed_at":"2026-08-11T14:32:23.961398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:23.967839Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:23.967839Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:3059d0e19cdaec9a7fb2cb1fc07c8cec4ea4cd51a58a7beb309edabb8d41519a","observation_id":"035bdf88-99ce-4cc6-b9dc-e2ed49e03c43","resolution":{"observed_at":"2026-08-11T14:32:23.967839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:23.973390Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:23.973390Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:6db6e64f29d2266991c50f0f345fd47c5ac83e1f88daf7d82913b206bceeca40","observation_id":"b5a96e6b-c192-4d70-acda-28ccd1ec6c37","resolution":{"observed_at":"2026-08-11T14:32:23.973390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:25.435814Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"7e580335-e668-455e-8a54-4f5bb47f059b","year":2015},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:23.977901Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:aeea987bc352232f5fc88260c88f7073084cf8bab1e4fd72e21b29c50070a4c8","observation_id":"62f9e2d4-449a-4f49-ad5f-7cf5213ab149","resolution":{"observed_at":"2026-08-11T14:32:25.440345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T14:32:23.982843Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:23.982843Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:aedab6a2124dacf4a82f89d8ae652b428838b5da2fab753159b084f158302df2","observation_id":"93bbeb72-c089-409f-98ea-2c997b9552d5","resolution":{"observed_at":"2026-08-11T14:32:23.982843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T14:32:23.988040Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:23.988040Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:363fecf38063baf332464089a15b3e811425703b724db0bc54aa54fb4d3f4ac2","observation_id":"852c0aa7-4300-4d12-9b8c-1d799ec5fc97","resolution":{"observed_at":"2026-08-11T14:32:23.988040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:23.992676Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:23.992676Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:d8e6f372edc89d1f4808b3c0fd1d56b4f73150335fc227efd666c88c73731ab8","observation_id":"f12db218-a742-4884-8982-a61fdf98b014","resolution":{"observed_at":"2026-08-11T14:32:23.992676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:23.997107Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:23.997107Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:eead9105d8f3f16b9c3e01cd0352731afe4945d24b92c7a2a5aa8c31046b14c7","observation_id":"a628fea0-3935-4df9-9818-6536806544ff","resolution":{"observed_at":"2026-08-11T14:32:23.997107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-12T16:46:46.561976Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-11T14:32:24.002678Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.002678Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:c8b5d35e223859868976eab819dce9bc20b31637af8f0f80722d36107d9c6435","observation_id":"6f4a3150-cabf-41c9-a363-9bec991687a5","resolution":{"observed_at":"2026-08-11T14:32:24.002678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:24.007730Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.007730Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:37b4920f5fcc76b7e1fc7d90afefdaf06ee40ad48ec1e379af3fa173143fdf28","observation_id":"43d64e51-b62f-493e-93e8-6bdbd3d0edb5","resolution":{"observed_at":"2026-08-11T14:32:24.007730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-11T14:32:24.014339Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.014339Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:817792074f147e81288a3207a60c175dbaf98a954dbd80bc17493dd3be0d0d5d","observation_id":"2f86373d-cf48-4d4c-a6a4-e00ede609dbc","resolution":{"observed_at":"2026-08-11T14:32:24.014339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:25.413289Z","title":null,"venue":null,"work_id":"caffab58-523a-402c-9355-95fb082b6f9d","year":2024},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.019850Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:58eaab8e51ca29192a0de1c414eef32b2b03fbe646a67dda29e007be9c9ba4c0","observation_id":"08a9f958-ad6f-4d9c-ad0d-c027275e012f","resolution":{"observed_at":"2026-08-11T14:32:25.417739Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-11T14:32:24.024162Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.024162Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:59f148f3bf34f6fff8c678da4684fd18b0eac6aa226f00219d306040564607a2","observation_id":"69097bfa-6a16-45f7-8af3-c92decf80f84","resolution":{"observed_at":"2026-08-11T14:32:24.024162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:25.401609Z","title":"Shad Akhtar","venue":null,"work_id":"eb7fc3da-f25e-42e8-862c-e145481319f9","year":2022},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.029989Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:20bb8578ed92cb5aef931f039371e3ab2cc0d32b27bf8891dc04ea71f8801e88","observation_id":"004ee031-d801-4c02-84fe-9a47d934218b","resolution":{"observed_at":"2026-08-11T14:32:25.405513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:24.037709Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.037709Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:d2c2d6ac77798022b07e6b5730047bb17fdaf4882c28ed0f35374b09586a3815","observation_id":"ce49aa4e-75c5-421f-a76a-7f61aaea4ff5","resolution":{"observed_at":"2026-08-11T14:32:24.037709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-07T13:56:34.167869Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-11T14:32:24.044086Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.044086Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:7db019d5f0ce2e0cdcd049507b8c45ec6e8825860b04ec64b418d6b614c3159e","observation_id":"43977ba7-1e0c-4d27-a3fb-bff318f8a949","resolution":{"observed_at":"2026-08-11T14:32:24.044086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:25.380968Z","title":null,"venue":null,"work_id":"72745962-efbe-4b08-972e-95c79ba3aa19","year":2014},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.048526Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:d3aa7305712bbaaabad7eaeae0c0b5a56ff2b95f3173ec7675ffb805603feef4","observation_id":"3beb8068-6be9-4601-bf59-811de0273a90","resolution":{"observed_at":"2026-08-11T14:32:25.385188Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-319-20804-6","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:24.500642Z","title":"Hempelmann and Max Petrenko","venue":null,"work_id":"8d1610bc-e60c-447f-aa37-bb0f021417cf","year":2015},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.052545Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:65f3ffb028a199bf6f09119c425b5cf7de032014b8afcad809aea240970f6002","observation_id":"44670444-507d-4d7e-b1a8-386e948c1d91","resolution":{"observed_at":"2026-08-11T14:32:24.505200Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:24.057072Z","title":"understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.057072Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:180db68879e9067b739e06f89171dc32fef58327f581f46f9296523db4f7bb3e","observation_id":"a9351874-cd59-4313-a02e-8fadd181316b","resolution":{"observed_at":"2026-08-11T14:32:24.057072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-11T07:53:33.804680Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-11T14:32:24.061627Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.061627Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:27bd13c63077f40014e59e4a41c96644c4a7f6b5c2726c15fcf6124ce157c366","observation_id":"3853f0ae-45c3-44b3-a537-60687707fd4d","resolution":{"observed_at":"2026-08-11T14:32:24.061627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.05703","last_updated":"2017-10-03T15:08:49Z","snapshot_observed_at":"2026-07-06T06:04:24.583310Z","submitted_at":"2017-10-03T15:08:49Z","title":"A Survey on Optical Character Recognition System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.05703","snapshot_observed_at":"2026-08-11T14:32:24.067253Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.067253Z"},"links":{"cited_paper":"/paper/1710.05703","citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:77114b1745f74e9ea0093791f32d1796b6356512af06ce797ea27372a07b3895","observation_id":"a0468117-0a64-40a3-aabd-f571aaafb7d5","resolution":{"observed_at":"2026-08-11T14:32:24.067253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:24.071885Z","title":"Jentzsch and Kristian Kersting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.071885Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:0fe0fa90c72214bbfa34f7ca66c7e9091433dac37b2944174eb2212e28b02652","observation_id":"d96c3ecd-d107-493d-9d9b-5c74d54c90b5","resolution":{"observed_at":"2026-08-11T14:32:24.071885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:25.363789Z","title":null,"venue":null,"work_id":"1a116fa4-65b9-4419-b898-d6588f18cbfd","year":2024},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.076190Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:f17e0d1f111366e88fba090d0409852cf90623ee5b2b3b7cebad6f03645c7d16","observation_id":"4beef5b8-7773-4bfb-85d6-45546741c867","resolution":{"observed_at":"2026-08-11T14:32:25.368193Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:24.080728Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.080728Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:293e495b0ecee76ef55759f99ac9ae3d452334ef512b760ec2ba09f83cca7f0c","observation_id":"21c3cbff-1c59-437b-8915-980ebfe4f67a","resolution":{"observed_at":"2026-08-11T14:32:24.080728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:24.084830Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.084830Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:cdb67cabee74649f2a66a2770dbbed41582d427f4d4c8e359550254d0c87ed03","observation_id":"2bfe6190-b9af-4359-bda3-ba34485869bc","resolution":{"observed_at":"2026-08-11T14:32:24.084830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:24.088942Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.088942Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:5f6830ead065a854bf52aa262955bc104301fded819303a907db52cd18e16457","observation_id":"6580f86f-719c-45a1-aa74-8f95b49fdfda","resolution":{"observed_at":"2026-08-11T14:32:24.088942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:24.093327Z","title":"Shad Akhtar, and Tanmoy Chakraborty","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.093327Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:2431bc5e24c50aa4ff0c5095dacb835943fd5e95d6b64ff6716a61b586a84123","observation_id":"1ce38739-6130-4cf2-9551-3910407d90fc","resolution":{"observed_at":"2026-08-11T14:32:24.093327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T14:32:24.097985Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.097985Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:1af1e57266161b7c0ba0543f11fb01d1d716567b22c8eb49cc32f6b8970df5ab","observation_id":"6b5c1edd-1256-4e63-b648-5ae263f405bc","resolution":{"observed_at":"2026-08-11T14:32:24.097985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-12T22:28:12.899379Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-11T14:32:24.102856Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.102856Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:10bf66773f9c01cd04c7b9aa9a4a8cd1f2167f067478906d8cdd14ddc44a6421","observation_id":"6128c162-b42c-4fe6-a334-1957741d895b","resolution":{"observed_at":"2026-08-11T14:32:24.102856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:25.346969Z","title":null,"venue":null,"work_id":"943709ea-e1f2-4ba6-917f-9c095d1b5c43","year":2023},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.107689Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:91be6aa243bc1174ef96cb88e27b242049036ba3b3aca030657bbe8908cf03a6","observation_id":"54999733-23e1-4a69-93ec-6d4afe25447f","resolution":{"observed_at":"2026-08-11T14:32:25.353950Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-11T14:32:24.111651Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.111651Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:5252dad50fbb1838d609a9553ed6d47552a905e76bb6c3266f614b17c48199e9","observation_id":"250ff955-da11-46ac-b9ae-f4d948baa794","resolution":{"observed_at":"2026-08-11T14:32:24.111651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-11T14:32:24.115931Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.115931Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:f38163b4026e7b8687dacfa80042f8b3ccce1adb38856769e4cd3b250bb7b436","observation_id":"056d08a2-9b42-4b2c-b03c-abd07b9c6127","resolution":{"observed_at":"2026-08-11T14:32:24.115931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:25.331505Z","title":null,"venue":null,"work_id":"d5b55579-8238-4ae6-a262-862200a9a2df","year":2004},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.120870Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:bd0fa2c2a142638f30fed98ae40c6c1c87f1ab7a9e0413296e69b317fa8a9112","observation_id":"e12b1bfc-6887-40fb-a955-ae3a008acafc","resolution":{"observed_at":"2026-08-11T14:32:25.336455Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:24.124871Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.124871Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:f14e4ceb54df6bdf2e77da6804a8a3c5d1ebb5f346264595d9a1e1dbc73dd24c","observation_id":"b1c3d1c8-bd49-44bb-913f-3c9bed7b286b","resolution":{"observed_at":"2026-08-11T14:32:24.124871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:24.130228Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.130228Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:8bafadb804cc4cf508f55b4692448111dc7e41a23356863b51f3b7bafd146ad2","observation_id":"6637aaf6-9194-4b15-9673-1ea83eff68e7","resolution":{"observed_at":"2026-08-11T14:32:24.130228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:24.136321Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.136321Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:1a6ba857842a9c582907851b08770cff3b031faae0616dc7b892500852fef0fe","observation_id":"b43b6395-2859-4155-b78b-afaee8a0574c","resolution":{"observed_at":"2026-08-11T14:32:24.136321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:24.145349Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.145349Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:d90bc177415fcca437f63b94f67c41209c63a5059c60db84ad0213b5a4b77853","observation_id":"1d1186c9-33d2-40c4-aca5-3bbff9f98ced","resolution":{"observed_at":"2026-08-11T14:32:24.145349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:24.150350Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.150350Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:1236ec1a58cc51cdf510f8ee4808f74c84d29752672524af57e2f1d7bd7bcc7f","observation_id":"8c39c411-0505-457c-ba59-e4e27d0bb234","resolution":{"observed_at":"2026-08-11T14:32:24.150350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-07-06T15:26:46.489500Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-11T14:32:24.155176Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.155176Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:770d10892cdad06aec7e726f35ffee157224199f6746883752aef97efd578c10","observation_id":"fd08e849-abc3-42b0-89de-6adbc9eafb24","resolution":{"observed_at":"2026-08-11T14:32:24.155176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:24.160907Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.160907Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:f26c4d2b161607f347ee19776bf4f73241e08074ff3afce94778fd0b33c20851","observation_id":"155c773e-6217-4ed5-8bc6-b06ff623f143","resolution":{"observed_at":"2026-08-11T14:32:24.160907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:25.286677Z","title":null,"venue":null,"work_id":"51ec9d79-0c18-4cee-b983-5ccd886df5ff","year":2024},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.167428Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:bceb8502f4fa2c95436ae7800cc3c8a32bf483e00c5ad1d46afd2da5de56be1b","observation_id":"d63a6a51-e3e6-4954-8a54-674743f21fe1","resolution":{"observed_at":"2026-08-11T14:32:25.291799Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-08-09T19:40:57.491981Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-08-11T14:32:24.171691Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.171691Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:1ec818a55279322982f613a83389407ca4f3b1ad8966029f7a015a5dd48788d4","observation_id":"dc3a7763-ffdf-4f00-81bd-f23db2bba192","resolution":{"observed_at":"2026-08-11T14:32:24.171691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:24.177054Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.177054Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:2209ebff2b4f0a379c6ffc52e6ebafef08f48f0c61b706e8db393f60ab649f32","observation_id":"05a6ae08-6b39-4da7-8c78-fc9f61be9521","resolution":{"observed_at":"2026-08-11T14:32:24.177054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:25.262085Z","title":null,"venue":null,"work_id":"0b5710d9-17cb-416d-9e33-f95975f84602","year":2021},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.181845Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:5f663846d533a03e57305c141e897e2a83e7f0b40d3b99568189a0a2b9cd13e5","observation_id":"fac010c7-f2da-469e-a7c9-fe664e22c44c","resolution":{"observed_at":"2026-08-11T14:32:25.268512Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:24.187737Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.187737Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:abf5b684b2c51908bb890d0545723bc14866bad8da91b1da16202bdbe5d25549","observation_id":"0479987e-c342-462d-ab35-7c5b27ed6e2e","resolution":{"observed_at":"2026-08-11T14:32:24.187737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:24.193139Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.193139Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:e717b148fad634342f82615597138e0f04cbab46dadaad72a157d8c3e94576cd","observation_id":"823d8cfb-61e5-4a35-a764-3da7b7ba6b84","resolution":{"observed_at":"2026-08-11T14:32:24.193139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:25.239728Z","title":null,"venue":null,"work_id":"e885365a-2cec-4072-b43e-f9bc207064cc","year":null},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.198991Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:bed683ba23436ada29d1c8ce2107c9677748cca061dd27780ed1c1cbfb08024a","observation_id":"134e35b8-5315-499d-aa7c-4777426df522","resolution":{"observed_at":"2026-08-11T14:32:25.244216Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:25.226104Z","title":null,"venue":null,"work_id":"8c5bf274-d3a7-4378-ae53-05709ff58e0d","year":2024},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.203410Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:1caaf14517ef7c2264bd507c7ddee5d58d5ff1cedae69a1f4c0f85a7148a7135","observation_id":"ee710a41-a4e4-4b49-8aa4-d6b1b9146e2c","resolution":{"observed_at":"2026-08-11T14:32:25.230192Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T14:32:24.208076Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.208076Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:7cca9119dc0a8117183187470627d1305ade68cdb9d20227f99eea7b7dd260aa","observation_id":"6707c6f2-0790-4759-80b3-cc706b164135","resolution":{"observed_at":"2026-08-11T14:32:24.208076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03658","last_updated":"2025-01-06T06:01:17Z","snapshot_observed_at":"2026-08-13T04:25:32.736795Z","submitted_at":"2024-02-06T03:14:46Z","title":"Sentiment-enhanced Graph-based Sarcasm Explanation in Dialogue","version":2},"cited_work":{"arxiv_id":"2402.03658","doi":"10.48550/arxiv.2402.03658","metadata_source":"pith","pith_arxiv_id":"2402.03658","snapshot_observed_at":"2026-08-11T18:16:15.004306Z","title":"Sentiment-enhanced Graph-based Sarcasm Explanation in Dialogue","venue":"cs.CL","work_id":"bb32ec3e-feae-4931-9e1f-832a4030e3bb","year":2024},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.212415Z"},"links":{"cited_paper":"/paper/2402.03658","citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:904bd86babb110cd88887d5a87eccda481d1acaa552c03799bca98df92d0cd95","observation_id":"3c9840e9-ee6c-426c-af1a-ce9953aa2d19","resolution":{"observed_at":"2026-08-11T14:32:24.427432Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:24.216720Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.216720Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:140095ddd6f8e31d035c1f7be0690f7824ebf621fbdc4db66c88f838b12d71a7","observation_id":"169cd176-c5e2-4689-af92-c49a22ab68eb","resolution":{"observed_at":"2026-08-11T14:32:24.216720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:24.220621Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.220621Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:c26a09e5237712009997855946eba796b93a7afc7bfec55f6a76de4ac15aa4af","observation_id":"0d3c41c1-313a-4c64-8613-32e4d75e3212","resolution":{"observed_at":"2026-08-11T14:32:24.220621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-11T14:32:24.225069Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.225069Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:a19954fe044858d7a9121de212798e80609a1129dcda5a4a748aaf4d8ce047dc","observation_id":"03357f6a-6acb-4901-9202-66d328e27f2f","resolution":{"observed_at":"2026-08-11T14:32:24.225069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:25.212641Z","title":null,"venue":null,"work_id":"14593d35-48a0-433c-ae3f-8a34cd634d48","year":2023},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.230404Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:d4e22c676bb1590621a7a679611c63325cd6ba991997800c2a6def89393ea43e","observation_id":"9dcd7124-feb4-4d72-9133-41bd5983c16a","resolution":{"observed_at":"2026-08-11T14:32:25.217192Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T14:32:24.235828Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.235828Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:b9befb38b3a32d0064045a27648fe1b7da6e099872cd41ea8954489b944987a4","observation_id":"929841ed-1723-4904-ac4f-d9652cb6c6d9","resolution":{"observed_at":"2026-08-11T14:32:24.235828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T14:32:24.240116Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.240116Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:182b7d4b79079617d99feece56ca85fb0b4c3bae3985a2906f4647ac7c0e67b4","observation_id":"8b01a199-c6d8-4a41-b7f4-2bcaa0d93c00","resolution":{"observed_at":"2026-08-11T14:32:24.240116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T14:32:24.245357Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.245357Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:7c54064640b9fb7e36d10fd6131da905c1e1a27f0ca72be25dec23587c545c4a","observation_id":"99b63c82-52d6-4d31-9f6d-52ac0a6f4e3f","resolution":{"observed_at":"2026-08-11T14:32:24.245357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T14:32:24.249886Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.249886Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:5527d7e4798e7b43225ea4cab7fa75256e68cce4e3c87ad98fac220ad52c2961","observation_id":"ecb7134a-b6a2-4d1b-af30-570c73754c14","resolution":{"observed_at":"2026-08-11T14:32:24.249886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:24.256649Z","title":"Chi, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.256649Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:32bb3beb019b4e3e7263ca53a5d58d6702d2a11b2d653b4c0e8969dbc4faa3e5","observation_id":"b027ac88-2715-43ce-bdfc-6a69158b2a10","resolution":{"observed_at":"2026-08-11T14:32:24.256649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:24.260702Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.260702Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:8f49d501b80a93ad708f8cf9df4d790c05337e603f6a5b2b28bd7fdc1203f588","observation_id":"d28feb43-4c37-40c4-a08f-0912f67c64cf","resolution":{"observed_at":"2026-08-11T14:32:24.260702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-11T14:32:24.264933Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.264933Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:c0afdd5996522b943f6fdd81f2b6cce60c05a120132ffc40073b8da06c0f9429","observation_id":"3495a5cc-9c6c-4373-8f91-140e88aae686","resolution":{"observed_at":"2026-08-11T14:32:24.264933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-11T14:32:24.270645Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.270645Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:822e96caa3b8d8201c30de2605c40517493375628de01f9a0963437ba6a5d7e4","observation_id":"c79631fe-ba3d-4732-a4aa-1a9bc5bc0589","resolution":{"observed_at":"2026-08-11T14:32:24.270645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-11T14:32:24.274967Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.274967Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:2b8fd22c6d179cb0454c8ad892283dd4249e9f2c811013a119b3e1e61b6aa7be","observation_id":"09a1456b-bedd-4d14-9ff1-645f31ab03ca","resolution":{"observed_at":"2026-08-11T14:32:24.274967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11281","last_updated":"2024-06-20T13:12:31Z","snapshot_observed_at":"2026-08-13T04:17:02.514043Z","submitted_at":"2024-02-17T13:41:44Z","title":"Can Large Multimodal Models Uncover Deep Semantics Behind Images?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11281","snapshot_observed_at":"2026-08-11T14:32:24.280788Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.280788Z"},"links":{"cited_paper":"/paper/2402.11281","citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:e923751556e58613f59bbda06af245a7c4ba392dd5cd0877c7cc8c46f144f181","observation_id":"2647de70-3de1-47e8-aced-75b52d74b82d","resolution":{"observed_at":"2026-08-11T14:32:24.280788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-11T14:32:24.286144Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.286144Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:c9e61932ccf33a5ddc1bb08edf3c3e5ab5ce7ec1ea56c61eee75439e2816fcfe","observation_id":"3e011b5a-0936-425c-b80c-be766fa57521","resolution":{"observed_at":"2026-08-11T14:32:24.286144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:32:24.293670Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-11T14:32:24.293670Z"},"links":{"citing_paper":"/paper/2412.11906"},"observation_digest":"sha256:2c57774f489d636486058bed6e852ade7c70547c07dd60d45a7ed5f458451dbe","observation_id":"0814868b-c32d-4297-bf5f-a8b9f5ed6597","resolution":{"observed_at":"2026-08-11T14:32:24.293670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.11906","last_updated":"2025-06-17T13:33:58Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T06:16:56.499324Z","submitted_at":"2024-12-16T15:52:59Z","title":"PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":2,"verified_fuzzy":2},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2412.11906."}