{"as_of":"2026-08-18T22:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:77cfd8569cc26124fd32f4d4a4f58a851d30d8c5b2b67f5bd372753bfdc83e14","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:00:03.666933Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:21:12.121274Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17821","snapshot_observed_at":"2026-08-15T23:21:12.121274Z","title":"Videovista-culturallingo: 360 ^ horizons-bridging cultures, languages, and domains in video comprehension, 2025 h","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04921","last_updated":"2025-07-06T14:40:27Z","snapshot_observed_at":"2026-08-15T23:15:46.193892Z","submitted_at":"2025-05-08T03:35:23Z","title":"Perception, Reason, Think, and Plan: A Survey on Large Multimodal Reasoning Models","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T23:21:12.121274Z"},"links":{"cited_paper":"/paper/2504.17821","citing_paper":"/paper/2505.04921"},"observation_digest":"sha256:ddcb8654799fbf66ea5c5d04fbfe164b6d9054915b791aa2425e98d7d5032061","observation_id":"23230567-8d6d-4e3e-bfb5-008657d004eb","resolution":{"observed_at":"2026-08-15T23:21:12.121274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.17821/citation-record","integrity":"/paper/2504.17821/integrity","json":"/paper/2504.17821/citation-record.json","paper":"/paper/2504.17821"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-16T11:00:03.440183Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.440183Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:b2a70c76a5927e9ba0b09a85482795e5c7e757b5a441f3c2f8918be9cbf0c198","observation_id":"a610f35c-47f6-427a-bd63-3ff7d1c30a28","resolution":{"observed_at":"2026-08-16T11:00:03.440183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19479","last_updated":"2024-02-29T18:59:50Z","snapshot_observed_at":"2026-08-16T14:13:59.779732Z","submitted_at":"2024-02-29T18:59:50Z","title":"Panda-70M: Captioning 70M Videos with Multiple Cross-Modality Teachers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19479","snapshot_observed_at":"2026-08-16T11:00:03.445687Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.445687Z"},"links":{"cited_paper":"/paper/2402.19479","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:a2481ac570434920115bac381b92ce8218b655c7821e4bed1e752e46a7934015","observation_id":"9482bb42-850e-4de0-9b9e-9238f6446b3b","resolution":{"observed_at":"2026-08-16T11:00:03.445687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-16T11:00:03.449989Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.449989Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:fbac0d785fa6d2f50551f5ee3e50f3f29b10f147094fb9fe7fb04ace42273ddb","observation_id":"1c8ee396-9cb5-4dc6-abfa-f7f77019b6c6","resolution":{"observed_at":"2026-08-16T11:00:03.449989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-16T11:00:03.454622Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.454622Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:4601ffbeb49995066310e9f9a9e638b5a3c0a72d73d2879bac929e071dfea73c","observation_id":"127a5aa1-6d62-4f48-9d1c-ceaf86b6781e","resolution":{"observed_at":"2026-08-16T11:00:03.454622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-16T11:00:03.459045Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.459045Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:71911af5286ace9584535c9decb453401f748a581ffcbf997d19deb3ad7b62ab","observation_id":"a35ac029-0e78-4a41-a0c9-74f845b6895e","resolution":{"observed_at":"2026-08-16T11:00:03.459045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-16T11:00:03.464005Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.464005Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:9c1e74a90fe37cdc0c597e88413d1409d5820ce22a985cf0431013403fb13557","observation_id":"70026d46-fc90-435f-ae7e-87553b969b7e","resolution":{"observed_at":"2026-08-16T11:00:03.464005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-16T11:00:03.469725Z","title":"Smith, Hannaneh Hajishirzi, Ross Girshick, Ali Farhadi, and Aniruddha Kembhavi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.469725Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:b7d0e0fdf897f990a2d2b35927f54af5f680feab2ca5272e78feed1ba29ea380","observation_id":"9051d4e2-6476-4cf0-ae96-b12a1a39242e","resolution":{"observed_at":"2026-08-16T11:00:03.469725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14515","last_updated":"2024-10-30T13:38:10Z","snapshot_observed_at":"2026-08-17T20:22:23.176057Z","submitted_at":"2024-06-20T17:26:01Z","title":"MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14515","snapshot_observed_at":"2026-08-16T11:00:03.473696Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.473696Z"},"links":{"cited_paper":"/paper/2406.14515","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:99a53460161dcb57d5a94a58d8ec61888c1cb361d38213b899064a0f583e5de1","observation_id":"a386e1c8-8df6-49f4-a812-084e235ae6a5","resolution":{"observed_at":"2026-08-16T11:00:03.473696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-16T11:00:03.477776Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.477776Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:c6f08ac0b24a8e4d5d421843d0273b496aa8cc0fb56652e5f46c2fbd244d0153","observation_id":"e44d968d-0695-420b-a545-115b3aa54e79","resolution":{"observed_at":"2026-08-16T11:00:03.477776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:00:04.449495Z","title":null,"venue":null,"work_id":"1c71e5a9-ff4c-4e65-b03a-da45f979fdc1","year":2022},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.481652Z"},"links":{"citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:a12a4673f5a3891ac02306366261518d31046e0f00fca16918cba848db49092d","observation_id":"d3f1e497-125c-4a58-8be6-1cd561de75fc","resolution":{"observed_at":"2026-08-16T11:00:04.453645Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-16T11:00:03.485560Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.485560Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:75b45e659871343f40c1fc3697d5cef01d6074e20064976ed79d02f4d9dae90d","observation_id":"f5acbb57-9f48-4202-a2ac-48a5373ea403","resolution":{"observed_at":"2026-08-16T11:00:03.485560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:00:04.435119Z","title":null,"venue":null,"work_id":"0abf7825-209f-4f06-a3bf-141a978bc7e8","year":2018},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.489725Z"},"links":{"citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:b38378037726d4202bb3a1604c6ddf32d31391f9b8c2f57b6ac83a93dddb2ff3","observation_id":"a021d248-de30-4269-afba-17d8a32ce5e0","resolution":{"observed_at":"2026-08-16T11:00:04.439864Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-16T11:00:03.493355Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.493355Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:5ff9f383209903b82f4b790411b76b8e9480da0db695b5cf2ca7ac1bafc64ce0","observation_id":"e93ce6d5-4f91-4416-ab47-4a9b399245ab","resolution":{"observed_at":"2026-08-16T11:00:03.493355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17005","last_updated":"2024-05-23T14:49:29Z","snapshot_observed_at":"2026-08-14T11:10:08.135537Z","submitted_at":"2023-11-28T17:59:04Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17005","snapshot_observed_at":"2026-08-16T11:00:03.498647Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.498647Z"},"links":{"cited_paper":"/paper/2311.17005","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:e83191604cd6ff8bdba1167795cb58ccdd59fdcea5289fd8ecbf478f72874189","observation_id":"c9a7165a-78f0-4522-9a70-64d9b771a3a3","resolution":{"observed_at":"2026-08-16T11:00:03.498647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-15T21:13:34.833748Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13919","snapshot_observed_at":"2026-08-16T11:00:03.502576Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.502576Z"},"links":{"cited_paper":"/paper/2501.13919","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:00c4ceb69bc8f321d172496483f00c0faaaeb971c2512b4567b500c094016d5a","observation_id":"8e0c5624-eb6d-406b-a04a-1e8fd04b1e0c","resolution":{"observed_at":"2026-08-16T11:00:03.502576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:00:03.506606Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.506606Z"},"links":{"citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:af6c7acd59a57ecb04c180b84b98ad632d3b2578e4707681ce8fa28341429037","observation_id":"89e06abe-9ca8-44b5-ab3a-7049a627d3e0","resolution":{"observed_at":"2026-08-16T11:00:03.506606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11303","last_updated":"2024-06-17T08:09:00Z","snapshot_observed_at":"2026-08-16T13:42:22.602032Z","submitted_at":"2024-06-17T08:09:00Z","title":"VideoVista: A Versatile Benchmark for Video Understanding and Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11303","snapshot_observed_at":"2026-08-16T11:00:03.510166Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.510166Z"},"links":{"cited_paper":"/paper/2406.11303","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:a9eca26dc3b6a5c0ba530de78b0684dd8fbdae845f85aff1dc4cd6d5be7a5eda","observation_id":"b5505f57-9cca-42c6-b025-27e7cb73779f","resolution":{"observed_at":"2026-08-16T11:00:03.510166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:00:03.514208Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.514208Z"},"links":{"citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:d0cb187ba4473ecdec6f5e908fd3a40b87b620df7f2740960c8cfe860a9e3a60","observation_id":"10500438-ab93-4423-97cc-d255bad68e1b","resolution":{"observed_at":"2026-08-16T11:00:03.514208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:00:03.518752Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.518752Z"},"links":{"citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:816c2a0d674ce1e9bcfb31ba042f7ff8c44a34954e3a95312dca2d039e587e68","observation_id":"eb9c21e1-c7a6-4149-a535-4833a2a5dd9d","resolution":{"observed_at":"2026-08-16T11:00:03.518752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-16T11:00:03.523123Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.523123Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:22fa74934a19a4ddb894b45e070daded06ef2ff7050db705d43e13c2a634683e","observation_id":"ea5d9e1c-ebf7-4f3a-b88b-fe80723433de","resolution":{"observed_at":"2026-08-16T11:00:03.523123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-08-16T14:35:22.253216Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-08-16T11:00:03.530163Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.530163Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:ffb894dbaf8300377f910adfcc9650e36d1177894dbc43f489a2177839c33423","observation_id":"12d8bbdc-4979-4dcc-ac72-5ff9ec7a77f8","resolution":{"observed_at":"2026-08-16T11:00:03.530163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-16T11:00:03.535087Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.535087Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:d8af10532a754ac5cc59e5f5132f0463ce98cc716cf0d2d7dd3403f3b91de550","observation_id":"46c87361-23b2-4fd7-ad94-a7b55e24fd8f","resolution":{"observed_at":"2026-08-16T11:00:03.535087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-08-17T03:48:18.599994Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-16T11:00:03.539457Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.539457Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:8848c3d898ae0f03a20d5a354d56e19de9ab450115e6ba31c21095c791e25b6f","observation_id":"63487eb0-6cb8-4223-97b3-7b856b3017a8","resolution":{"observed_at":"2026-08-16T11:00:03.539457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-12T14:24:43.915700Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-08-16T11:00:03.544988Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.544988Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:974bc2bc01acf89a5bc8118a9744b9ace46f293673dd461870e342d09615f242","observation_id":"702622c8-0b25-4d84-b597-9cfd11b1ab63","resolution":{"observed_at":"2026-08-16T11:00:03.544988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-08-16T13:17:05.325564Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-08-16T11:00:03.549842Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.549842Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:b0e337441823408c401d61a8f5042f1ac06c39ed1706c4e26cb06a3fc38d25fa","observation_id":"a73585c4-cc32-4249-9408-473bea2aa5c0","resolution":{"observed_at":"2026-08-16T11:00:03.549842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:00:03.554564Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.554564Z"},"links":{"citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:5c959defd081004aea0f090b1f38da23100555ab7e61aeecc82a4fb9332ca739","observation_id":"50579325-f441-4c1d-974c-e54258189fb8","resolution":{"observed_at":"2026-08-16T11:00:03.554564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:00:04.404725Z","title":null,"venue":null,"work_id":"e634769a-a1ef-4d8e-b63b-24b78435e57f","year":2024},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.559148Z"},"links":{"citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:9868a416737169f90f11c7ad0f7fc5d9e0f4756f13768016ba4baf452939fdfd","observation_id":"25b8f88d-331a-4099-b8d2-76dc7acbdbcc","resolution":{"observed_at":"2026-08-16T11:00:04.409641Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-16T11:00:03.563688Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.563688Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:772fc6c3dd32e15f18159122998a4e26d7f07241cdad59b3a71cf999a4b2dcaf","observation_id":"f417843c-2461-4162-bd5e-d0bd44bbbe88","resolution":{"observed_at":"2026-08-16T11:00:03.563688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:00:03.568528Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.568528Z"},"links":{"citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:bf91453ad3ce752b51e2b36c68819c49ac6060e2cff160f90ec4f75a6b283b7b","observation_id":"19103175-033e-4212-adf8-646344080015","resolution":{"observed_at":"2026-08-16T11:00:03.568528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-16T11:00:03.575717Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.575717Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:99fd06fffebd8405b2a6b8107c8311c076efe838a0a231a20cfbb01ec8406b4e","observation_id":"3eff4938-6bef-476e-852b-4d37ada7ae00","resolution":{"observed_at":"2026-08-16T11:00:03.575717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-16T11:00:03.583634Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.583634Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:6999b20e4a9ffee0179e27e6d48098255a4f09a392e0ff18997b22417d33b84b","observation_id":"182fda96-18ca-4532-8673-092e54e48300","resolution":{"observed_at":"2026-08-16T11:00:03.583634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-16T11:00:03.588993Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.588993Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:eeb7335852e212eecd4f431e8698d649bfba43fc7f4cb30f204e2a3375342cb3","observation_id":"ab42477c-3080-486d-b3a8-83686e267024","resolution":{"observed_at":"2026-08-16T11:00:03.588993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-16T11:00:03.593515Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.593515Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:97cbf554c406c1c06bfe486a79cada7820c35179750986dbdf99be257c8d73d7","observation_id":"b91cced1-9938-40a1-a83b-b77f4acdead4","resolution":{"observed_at":"2026-08-16T11:00:03.593515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:00:03.600002Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.600002Z"},"links":{"citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:2af25371b79918579727a14984317a8c2256122861679671bb290b97da6c62d1","observation_id":"0f9d9766-4e47-4ead-b88f-c70b87755de8","resolution":{"observed_at":"2026-08-16T11:00:03.600002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:00:03.609657Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.609657Z"},"links":{"citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:c294435b97b77a9e82dca444ecd125db08bfb9e3db31e6c62ae30b917a679e32","observation_id":"e0106d1f-4328-4876-97be-e29f4f2c3df0","resolution":{"observed_at":"2026-08-16T11:00:03.609657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-16T11:00:03.614556Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.614556Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:b38e59f7b611cbbbe4fc81eec15ad4f5f865ccf68c477e0acc5ba4d53895968f","observation_id":"f85781bd-525f-4f60-b09c-7855a3af871b","resolution":{"observed_at":"2026-08-16T11:00:03.614556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-16T11:00:03.621553Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.621553Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:43afbf2da9bf9f17d3d45afae463d51a909d64dcb475b9e149f7825674200d56","observation_id":"98e7b97f-5559-4f2d-be8d-6e98cb97d891","resolution":{"observed_at":"2026-08-16T11:00:03.621553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-08-16T23:01:47.789827Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-16T11:00:03.626587Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.626587Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:22cabb52189d67aeeb2acacd1a6baf82f3f5a671a275e98a04b6400f81846319","observation_id":"9bc97747-c0e7-447a-abec-d1b61d007bac","resolution":{"observed_at":"2026-08-16T11:00:03.626587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:00:04.366014Z","title":null,"venue":null,"work_id":"4930ea40-b9a7-44e6-8853-ccecc0bcfef0","year":2019},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.635224Z"},"links":{"citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:ddbda83040ea398efb4e0cfd6cca6e32a01676d2561cdaf398aa4077cad8e77d","observation_id":"6433f426-bd9d-49c7-a665-7ed466125357","resolution":{"observed_at":"2026-08-16T11:00:04.370958Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:00:03.639558Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.639558Z"},"links":{"citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:d06093d03fafed598eacb139d73454759b234e58dcf90981beaac06692942c98","observation_id":"57b827dd-babf-4a19-a9f1-3071a60e5b2b","resolution":{"observed_at":"2026-08-16T11:00:03.639558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-08-13T11:53:19.464291Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-16T11:00:03.644348Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.644348Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:030e745af7ea647b2087011f12f6ffaff1eb0093a065bbff6ccc8dd74c4a0232","observation_id":"5e98e299-6735-4e30-bb5a-371982ee797d","resolution":{"observed_at":"2026-08-16T11:00:03.644348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-16T11:00:03.648627Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.648627Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:be443361010bdfb8d58d60d2569c3e5ac5fb5b62121e4f2c64e4f5d1a6a20b29","observation_id":"b4b56268-dd2f-4396-9f16-2f5dbf29d58d","resolution":{"observed_at":"2026-08-16T11:00:03.648627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-16T11:00:03.653483Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.653483Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:a4b457ede646ad9739874f0c8989f17181d0c2ba46545d9e26acb77f5ae3148c","observation_id":"52da37b1-e70b-414b-94f3-fe1c7633f1bb","resolution":{"observed_at":"2026-08-16T11:00:03.653483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-16T11:00:03.657796Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.657796Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:b06d2f2c7d04f92ad1b8ab526fbb434342844be00bd5b0e25c50927e78114c74","observation_id":"212dc451-1990-41ac-bf03-02aa60471bf2","resolution":{"observed_at":"2026-08-16T11:00:03.657796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:00:03.662387Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.662387Z"},"links":{"citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:278f494400e2c32d11c121d9aee01839e6696d925203d6e131e70ea89596f51a","observation_id":"a3d67e98-a8b6-4673-b287-a5421ce19db0","resolution":{"observed_at":"2026-08-16T11:00:03.662387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:00:03.666933Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-16T11:00:03.666933Z"},"links":{"citing_paper":"/paper/2504.17821"},"observation_digest":"sha256:c8fe76264107ac3d25b9109c278c1ac5ebc22a1ee182c48ef34794764ebc8366","observation_id":"8e31cca6-be2a-488e-877d-d0c6123a751e","resolution":{"observed_at":"2026-08-16T11:00:03.666933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.17821","last_updated":"2025-05-20T09:15:16Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T23:02:38.908055Z","submitted_at":"2025-04-23T13:47:30Z","title":"VideoVista-CulturalLingo: 360$^\\circ$ Horizons-Bridging Cultures, Languages, and Domains in Video Comprehension"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 1 inbound Pith citation observation for arXiv:2504.17821."}