{"as_of":"2026-08-18T14:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d7020c30cac56acf8ceec84dc7a78df17806b9a898be823274b5a33155d003c5","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:59:33.853704Z","state":"measured"},{"denominator":80,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":80,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.08455/citation-record","integrity":"/paper/2505.08455/integrity","json":"/paper/2505.08455/citation-record.json","paper":"/paper/2505.08455"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.234825Z","title":"Robovqa: Multimodal long-horizon reasoning for robotics","venue":null,"work_id":"3276658d-37ba-4ca8-9437-ddcd67a5ff59","year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.444017Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:80b467c7b9cbfc0ec791a7f9bf668f7572af1237a50c3ae2d7c40ea01c658dd9","observation_id":"0b89677d-3b55-4f0b-b0fa-46f60380ab2e","resolution":{"observed_at":"2026-08-15T21:59:35.239931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19693","last_updated":"2024-06-28T07:09:06Z","snapshot_observed_at":"2026-08-18T08:01:15.085723Z","submitted_at":"2024-06-28T07:09:06Z","title":"MMRo: Are Multimodal LLMs Eligible as the Brain for In-Home Robotics?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19693","snapshot_observed_at":"2026-08-15T21:59:33.450018Z","title":"Mmro: Are multimodal llms eligible as the brain for in-home robotics? arXiv preprint arXiv:2406.19693, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.450018Z"},"links":{"cited_paper":"/paper/2406.19693","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:760f99df727ebb89d207b0208db7e1bc5237baa4d16493b1cdb2a0641e98958c","observation_id":"c878ab8e-0a4b-4286-9bb6-0c705479fbd3","resolution":{"observed_at":"2026-08-15T21:59:33.450018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06722","last_updated":"2024-06-11T06:53:44Z","snapshot_observed_at":"2026-08-16T19:41:21.903959Z","submitted_at":"2023-12-11T03:35:58Z","title":"EgoPlan-Bench: Benchmarking Multimodal Large Language Models for Human-Level Planning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06722","snapshot_observed_at":"2026-08-15T21:59:33.455775Z","title":"Egoplan-bench: Benchmarking multimodal large language models for human-level planning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.455775Z"},"links":{"cited_paper":"/paper/2312.06722","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:4da69f15f1e63168d3c8991a9deda659d2aa5f240025015d431f035fcca8a62a","observation_id":"236615c5-5e79-4ada-ba59-d2b445ddf7cc","resolution":{"observed_at":"2026-08-15T21:59:33.455775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.219267Z","title":"Openeqa: Embodied question answering in the era of foundation models","venue":null,"work_id":"19aaedda-22fe-47d2-8630-234801ae1726","year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.461137Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:f6b14ed8e0abf62812fd459a753a480fabbcfc8139e8668322cdd11de42ee0ab","observation_id":"144edce9-8fb6-4610-bc43-0d037e06a919","resolution":{"observed_at":"2026-08-15T21:59:35.224949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02071","last_updated":"2023-11-28T11:23:14Z","snapshot_observed_at":"2026-08-16T14:55:29.088594Z","submitted_at":"2023-10-03T14:13:36Z","title":"Towards End-to-End Embodied Decision Making via Multi-modal Large Language Model: Explorations with GPT4-Vision and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02071","snapshot_observed_at":"2026-08-15T21:59:33.466110Z","title":"Towards end-to-end embodied decision making via multi- modal large language model: Explorations with gpt4-vision and beyond","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.466110Z"},"links":{"cited_paper":"/paper/2310.02071","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:c9ac5425e712da8e8a12dffdadb5ed635d4760e4d9d7576a1765bc5d7da821c5","observation_id":"d80e3b03-69f1-440e-8910-a0d0c85dc28a","resolution":{"observed_at":"2026-08-15T21:59:33.466110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09848","last_updated":"2025-04-14T03:38:31Z","snapshot_observed_at":"2026-08-16T12:41:30.990282Z","submitted_at":"2025-04-14T03:38:31Z","title":"A Survey of Large Language Model-Powered Spatial Intelligence Across Scales: Advances in Embodied Agents, Smart Cities, and Earth Science","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09848","snapshot_observed_at":"2026-08-15T21:59:33.471828Z","title":"A survey of large language model-powered spatial intelligence across scales: Advances in embodied agents, smart cities, and earth science","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.471828Z"},"links":{"cited_paper":"/paper/2504.09848","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:38bcee95cabf220f14a808908bacd492abdce1d9542ddd5feafff67a7c3f8656","observation_id":"6f59abb2-0476-4a6d-a816-b4485f291313","resolution":{"observed_at":"2026-08-15T21:59:33.471828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.203415Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":"a6023340-d58d-42fe-a8a3-c4311cfc76bf","year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.477225Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:a02e2a2e136a9fec377d549c69d494a07f1a0a22ad77b9edb772bc3fec0e5564","observation_id":"45022173-519c-455a-bc87-57177bbf8318","resolution":{"observed_at":"2026-08-15T21:59:35.208399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05973","last_updated":"2023-11-02T06:53:37Z","snapshot_observed_at":"2026-08-05T01:03:23.456778Z","submitted_at":"2023-07-12T07:40:48Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05973","snapshot_observed_at":"2026-08-15T21:59:33.483140Z","title":"V oxposer: Composable 3d value maps for robotic manipulation with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.483140Z"},"links":{"cited_paper":"/paper/2307.05973","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:0d5362aac968f793ccc5a1d1529787b92c549e5d59ecf6853b2079bca8f69405","observation_id":"6cb698aa-a7bd-4323-8b10-e43c707f888d","resolution":{"observed_at":"2026-08-15T21:59:33.483140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11217","last_updated":"2024-11-29T02:50:45Z","snapshot_observed_at":"2026-08-16T14:17:47.173829Z","submitted_at":"2024-02-17T08:04:23Z","title":"A Spectrum Evaluation Benchmark for Medical Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11217","snapshot_observed_at":"2026-08-15T21:59:33.489753Z","title":"A spectrum evaluation benchmark for medical multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.489753Z"},"links":{"cited_paper":"/paper/2402.11217","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:860a31e8663a21097ed231c50c4bed1839c0f66a797ff2595f970dfa780c6fb4","observation_id":"46c22944-33a7-4cec-936e-4a58d7efeb44","resolution":{"observed_at":"2026-08-15T21:59:33.489753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-16T14:04:54.843248Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-15T21:59:33.495030Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.495030Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:788c4581a42d6042f86b12cc3eccd4f50a4d06c4ce7b7126e0014fe4aaf6b8d1","observation_id":"81b998e8-84cd-4ebd-82ad-3ab02563bc02","resolution":{"observed_at":"2026-08-15T21:59:33.495030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.188097Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"decf1ac2-d1b9-42e6-841c-3946bc64c686","year":2021},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.500010Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:05dc72d9f141af69f29ebf349a8358a710c7349fe5aa2529a52b2c42a06b3db9","observation_id":"e50418e7-bf9e-4d51-86fd-1264daa20d9b","resolution":{"observed_at":"2026-08-15T21:59:35.193579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.172405Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"61fbb26b-8107-4bee-8ae9-bd922a29d423","year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.504583Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:7dfbbb134aabc4e76f2882228a20fe22a44cb4a390cdb20624f4fd0234f115d5","observation_id":"cdff0e5f-ee66-4d28-a96b-3f5716613f57","resolution":{"observed_at":"2026-08-15T21:59:35.178154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15377","last_updated":"2024-08-14T14:31:50Z","snapshot_observed_at":"2026-08-16T20:34:09.579602Z","submitted_at":"2024-03-22T17:57:42Z","title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15377","snapshot_observed_at":"2026-08-15T21:59:33.509378Z","title":"Internvideo2: Scaling video foundation models for multimodal video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.509378Z"},"links":{"cited_paper":"/paper/2403.15377","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:5602eacb991844cd0a3ff310dc534e4cd42512fc6db0d6d0d40558e9fd7e5c12","observation_id":"82f532e7-71c2-45e0-b07e-e60c41ae0a9c","resolution":{"observed_at":"2026-08-15T21:59:33.509378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-08-13T11:36:11.821356Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-15T21:59:33.514987Z","title":"Longvu: Spa- tiotemporal adaptive compression for long video-language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.514987Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:cafa7f3c14c06a52797f1b81ac09c0a40a0a71bbb2f6820307179630ca95d441","observation_id":"96598b34-9e8d-4787-afd8-98e1cfe4e53e","resolution":{"observed_at":"2026-08-15T21:59:33.514987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15841","last_updated":"2024-09-15T05:00:18Z","snapshot_observed_at":"2026-08-16T13:32:02.889396Z","submitted_at":"2024-07-22T17:58:04Z","title":"SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15841","snapshot_observed_at":"2026-08-15T21:59:33.520336Z","title":"Slowfast-llava: A strong training-free baseline for video large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.520336Z"},"links":{"cited_paper":"/paper/2407.15841","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:a17a849e22c8b53bf04249006650a454258d937546e2391ff27ace29dc33a56c","observation_id":"7270f04b-5650-4b02-bbef-ae2a4a921ff8","resolution":{"observed_at":"2026-08-15T21:59:33.520336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.157260Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":"3ab83cb6-330a-4864-913b-e2574c10dad1","year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.525739Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:9361ba327292630e60ed036b766e6bb44cddfe81c18ada832201d131e86670d5","observation_id":"605c03e1-405b-4afc-b7ee-1ac3815bde4b","resolution":{"observed_at":"2026-08-15T21:59:35.162399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-16T14:39:31.347488Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-15T21:59:33.532560Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.532560Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:178ecf48dbe7ce1e786617921464d3d87f5a385bb336c6e6d2cdac9c83470618","observation_id":"a418e650-accc-4d06-8ae2-41cfbd230895","resolution":{"observed_at":"2026-08-15T21:59:33.532560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-15T21:59:33.537472Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.537472Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:0242eacfbb063da6af294a664f051fcf99c375f76fff54b7ab3ef129335fd261","observation_id":"ae912172-be3e-4f6d-ac41-6e33bfe252ab","resolution":{"observed_at":"2026-08-15T21:59:33.537472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-08-13T11:53:19.464291Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-15T21:59:33.543100Z","title":"Videollama 3: Frontier multimodal foundation models for image and video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.543100Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:f70a780464e587c9af5d668e7d1735f2b4608dbb72c4810b602490891d07472f","observation_id":"50caf98d-008e-4c68-b7f7-a27bc88dd2a9","resolution":{"observed_at":"2026-08-15T21:59:33.543100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.142524Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":"328790d9-52b5-45b8-bf53-a285964308e7","year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.547817Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:746ef2a364f81be12cb032bb211bb82e5e1698eb9d4c002f0d1d7717e551b8f3","observation_id":"9cf4d981-c735-4225-bb99-f5f4764d190b","resolution":{"observed_at":"2026-08-15T21:59:35.147759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-16T04:27:36.181491Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-15T21:59:33.552216Z","title":"Longvila: Scaling long-context visual language models for long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.552216Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:fc5ecf770c1040ae108384f41b3a456d8b0d3b56ffc945ea133ac79bc4402e57","observation_id":"bb79dd26-bed0-4924-b083-bc95c8cfb7b3","resolution":{"observed_at":"2026-08-15T21:59:33.552216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-15T21:59:33.557150Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.557150Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:ae3537c915186f236c647e6d9e818c0c6e4a0b83bd84675d3063f221d665cc07","observation_id":"bfdc15e9-adde-4fe9-a13d-624b11eb2769","resolution":{"observed_at":"2026-08-15T21:59:33.557150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-15T21:59:33.562745Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.562745Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:91ee971f44009f9ef2d06ead6c7b8e91b49413dc6000dfe5a40b94df1c865626","observation_id":"e5439363-9c59-44d3-a269-b8b7db28832c","resolution":{"observed_at":"2026-08-15T21:59:33.562745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-15T21:59:33.567661Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.567661Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:cf50c609a087d447491f1a1b299e5303da3e7d032d2efc39c6676480b296516d","observation_id":"578520e5-b3bb-4afe-9cc2-8bb64ce22f25","resolution":{"observed_at":"2026-08-15T21:59:33.567661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.126850Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"fdd1e778-da38-4aa4-8d53-0f9efea9743f","year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.572655Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:35043350189371da3699b5d5cb6bc070144e04159df353b4a31f0a06c7982cd4","observation_id":"43c1aa7a-e644-415c-9837-9a358b3c61b3","resolution":{"observed_at":"2026-08-15T21:59:35.132123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-15T21:59:33.577918Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.577918Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:083394b512fd68ed1f55e5fc1634cd1ce7416a3b9ae0aff2b4dc9b322f190a1e","observation_id":"1ebae743-b61f-48fa-b400-fbdbd49df6e4","resolution":{"observed_at":"2026-08-15T21:59:33.577918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.111602Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization","venue":null,"work_id":"1174e36b-f7a4-4575-b1ac-2fd94853cfdf","year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.582957Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:c67d8ee1da494f9a5104ab7768a57057a45f14284a449bc42adc7f5973a911ba","observation_id":"abc00dbc-3b25-4895-8253-99514193ed0c","resolution":{"observed_at":"2026-08-15T21:59:35.116420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T21:59:33.587609Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.587609Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:47d6dc3469ac76046d1c3eda6f60250a6650878c9bf6ad8f362afbcef062a76f","observation_id":"ed7d0b5a-a7ca-4ac5-b33c-f162c980f986","resolution":{"observed_at":"2026-08-15T21:59:33.587609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.079984Z","title":"Intentqa: Context-aware video intent reasoning","venue":null,"work_id":"727a4f4e-2967-478a-96c3-da30a609f250","year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.597957Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:1f3a7d3e03781fa13506f12fbf21a7e881c9f8ad1098d3436a42609ff33ca435","observation_id":"8d2f1091-ee92-4f41-b884-c575b4d27450","resolution":{"observed_at":"2026-08-15T21:59:35.084753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.063885Z","title":"Rex- time: A benchmark suite for reasoning-across-time in videos","venue":null,"work_id":"374d65f5-5914-4bb6-b341-eba51daa608a","year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.602270Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:2122bb7c8c823b922797174ca88215a8087434c205810b8648a5859f2f7e0f80","observation_id":"852a0e58-1b22-4e8e-903b-0ef34fe7db90","resolution":{"observed_at":"2026-08-15T21:59:35.069675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.046730Z","title":"From representation to reasoning: Towards both evidence and commonsense reasoning for video question-answering","venue":null,"work_id":"8ef6dec4-0af9-47de-bd0b-7ec55f98b8d0","year":2022},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.607218Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:a0f178f203a1be4ba03f9de9247470ab1f35390d77175d8708b8cd8efe572b89","observation_id":"95eb2e73-826e-45ec-ba3f-6e5aa90e6e69","resolution":{"observed_at":"2026-08-15T21:59:35.052199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-15T21:59:33.611835Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.611835Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:cf10c6c8e845436305e01c6fb244612b0e0580ba7e65058cd15f4632eaa11dbe","observation_id":"a9ef2c91-79b1-4a9a-ab86-7279b66c08b5","resolution":{"observed_at":"2026-08-15T21:59:33.611835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.030846Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":"b3cf0e8f-3e9f-4d75-b760-7ea3f5ddeb19","year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.617442Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:9e8da506197321da7855ce7f9296b47518eefb7dedb197b18547dff0d818ec6e","observation_id":"906e0ef9-b0e3-40b6-a7d0-d3b554e4d1d6","resolution":{"observed_at":"2026-08-15T21:59:35.036159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00574","snapshot_observed_at":"2026-08-15T21:59:33.622058Z","title":"Videochat-flash: Hierarchical compression for long-context video modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.622058Z"},"links":{"cited_paper":"/paper/2501.00574","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:3c4b68ce86a243a5f3e64f6e0dc24d214c63725761d127d15bbee833ddd7350e","observation_id":"c725de8b-4d3c-42b8-bbb1-e77eda694019","resolution":{"observed_at":"2026-08-15T21:59:33.622058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-08-16T13:40:35.133323Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-08-15T21:59:33.626864Z","title":"video-salmonn: Speech-enhanced audio-visual large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.626864Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:0470d9660590483a2b2df18d790a18238eccdd0e4c5e6501057485cd53b6249e","observation_id":"ec3dd096-487a-4ce7-8741-b02ab8275c7c","resolution":{"observed_at":"2026-08-15T21:59:33.626864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09418","last_updated":"2024-06-13T17:59:59Z","snapshot_observed_at":"2026-08-16T13:43:12.933116Z","submitted_at":"2024-06-13T17:59:59Z","title":"VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09418","snapshot_observed_at":"2026-08-15T21:59:33.631527Z","title":"Videogpt+: Integrating image and video encoders for enhanced video understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.631527Z"},"links":{"cited_paper":"/paper/2406.09418","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:2c852fc4758fe3c257bf456ded3050f7134c3239691d51f0e181018652c6e053","observation_id":"01a1d4b7-fae9-465e-a4fd-a4c44af26b47","resolution":{"observed_at":"2026-08-15T21:59:33.631527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:33.637682Z","title":"Video understanding with large language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.637682Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:808ea2845764343df02e032f4a46197ee3797399d0ab3b0779c0172cd455356a","observation_id":"4e1f5f85-d232-4aab-8ea3-c116692f5b5e","resolution":{"observed_at":"2026-08-15T21:59:33.637682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03770","last_updated":"2024-05-06T18:09:48Z","snapshot_observed_at":"2026-08-16T13:54:55.899708Z","submitted_at":"2024-05-06T18:09:48Z","title":"Foundation Models for Video Understanding: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03770","snapshot_observed_at":"2026-08-15T21:59:33.642396Z","title":"Foundation models for video understanding: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.642396Z"},"links":{"cited_paper":"/paper/2405.03770","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:7ee534355d490c2fe63173b8f03d1b1592c8542d118592a5bda7b6227a71efee","observation_id":"920f45ec-7d6e-4994-a205-3e17288a260c","resolution":{"observed_at":"2026-08-15T21:59:33.642396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:33.647351Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.647351Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:e0b4bbf98248275c2c73fe77711bca93cfac1421379c739c3a6ca387ca9d01e2","observation_id":"6ae3780d-0c83-40ce-a81c-fa06d730fe3f","resolution":{"observed_at":"2026-08-15T21:59:33.647351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.002743Z","title":"Video question answering via gradually refined attention over appearance and motion","venue":null,"work_id":"22709430-ca43-4309-bfc1-fd7d498189dc","year":2017},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.653452Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:3b66320697b776452b0dd127d790619cdf3dd78c81bc06c930983c7ce2a257b7","observation_id":"eca70cb1-cdc6-4f87-93d4-b83935edb694","resolution":{"observed_at":"2026-08-15T21:59:35.008796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:34.985891Z","title":"Next-qa: Next phase of question- answering to explaining temporal actions","venue":null,"work_id":"5d393a3d-9376-44fb-bce0-b6accbf590be","year":2021},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.658131Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:210a87e96ead10ef47d5f359a203cffe5d0f1d3172b3ab273e2ee6141edcefd4","observation_id":"2a023add-8aef-4e6e-8b2f-07d2cf103131","resolution":{"observed_at":"2026-08-15T21:59:34.990702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:34.970695Z","title":"Tgif-qa: Toward spatio-temporal reasoning in visual question answering","venue":null,"work_id":"0db04fd8-3181-4ced-a1cc-4d34a2b043fe","year":2017},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.663554Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:7d8e68ed44ea58000a162dd3bb56dabd56d2cefc139e9177f0c75a497893446a","observation_id":"acea9151-c1c2-4783-9c9f-1d659178ccc0","resolution":{"observed_at":"2026-08-15T21:59:34.975540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07752","last_updated":"2025-03-25T09:46:02Z","snapshot_observed_at":"2026-08-16T13:10:47.063439Z","submitted_at":"2024-10-10T09:28:36Z","title":"Lost in Time: A New Temporal Benchmark for VideoLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07752","snapshot_observed_at":"2026-08-15T21:59:33.668469Z","title":"Tvbench: Redesigning video-language evaluation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.668469Z"},"links":{"cited_paper":"/paper/2410.07752","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:a9bd13512cb954edc238a3b633b2c6263ecb0693b9fe6a5bfcc67fe0e50b6ac0","observation_id":"e75fe3f7-da28-4ef7-8baf-7a88741e82dc","resolution":{"observed_at":"2026-08-15T21:59:33.668469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-15T21:59:33.674311Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.674311Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:a90f55c49da965e82d21a506a3a00e170bec5c712cc3a82053d42fc9b12f69a3","observation_id":"e39db794-266f-4f71-b8c6-afea1340d505","resolution":{"observed_at":"2026-08-15T21:59:33.674311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-12T14:24:43.915700Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-08-15T21:59:33.679506Z","title":"Tempcompass: Do video llms really understand videos? arXiv preprint arXiv:2403.00476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.679506Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:cf03f24f587652e0df501b4b687975383e270980857b270b9f8f6994ef15025c","observation_id":"0efe9d6d-0a96-4d3d-b9df-09d0c1139a53","resolution":{"observed_at":"2026-08-15T21:59:33.679506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-16T13:09:28.872428Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-08-15T21:59:33.684509Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.684509Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:e90e963dbf0ab7d2ac88ccb28110d85169f04ccd6532da332c5eec6ff9c68d54","observation_id":"dd700fdb-2a23-43c3-9a61-04b000dd0e50","resolution":{"observed_at":"2026-08-15T21:59:33.684509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-15T21:59:33.689913Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.689913Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:5a529ce2055268ebe711ff0417d35a22a861733c8c26ea3bad79b984bf604c93","observation_id":"861cd7f6-85bf-478e-bea8-bf3dc51f9482","resolution":{"observed_at":"2026-08-15T21:59:33.689913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:34.954867Z","title":"Longvideobench: A benchmark for long- context interleaved video-language understanding","venue":null,"work_id":"22887694-28d3-47e2-bf66-91d7a0d1df0d","year":2025},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.696191Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:c30358f07fc4b1313551ee4a9ccced67978b97da778e635a620b4054294402a5","observation_id":"bb3b54af-c5be-4614-b2b4-575ef17ec51b","resolution":{"observed_at":"2026-08-15T21:59:34.959836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:34.939702Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":"ffae61bf-d24c-4151-8ab1-56b590e91f1d","year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.701111Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:e0a707a9153653612068371311e9abb6957b72554a0f98baf395773172b6bf77","observation_id":"4af261fa-79dd-48c9-a700-bc67770e9b37","resolution":{"observed_at":"2026-08-15T21:59:34.944426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16338","last_updated":"2024-06-24T06:21:59Z","snapshot_observed_at":"2026-08-18T08:00:43.892091Z","submitted_at":"2024-06-24T06:21:59Z","title":"VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16338","snapshot_observed_at":"2026-08-15T21:59:33.705892Z","title":"Videohallucer: Evaluating intrinsic and extrinsic hallucinations in large video-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.705892Z"},"links":{"cited_paper":"/paper/2406.16338","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:66034edc0fd0f5fbc6ebba6d868e07c22472ce4b4cf2c3c5e18a6f0b14b4cadb","observation_id":"d0eb0d0b-aa1a-4a6d-83de-645e6b7d1a3a","resolution":{"observed_at":"2026-08-15T21:59:33.705892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14566","last_updated":"2024-03-25T06:05:24Z","snapshot_observed_at":"2026-08-17T08:51:17.030494Z","submitted_at":"2023-10-23T04:49:09Z","title":"HallusionBench: An Advanced Diagnostic Suite for Entangled Language Hallucination and Visual Illusion in Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14566","snapshot_observed_at":"2026-08-15T21:59:33.711050Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.711050Z"},"links":{"cited_paper":"/paper/2310.14566","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:e6644b9a536c7a2bf4916c323ba910b27811b1e39ecc973ccca870b61ecbf59e","observation_id":"3d5e342c-f4bb-4d8b-a56c-51bb49b5abcd","resolution":{"observed_at":"2026-08-15T21:59:33.711050Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:34.924242Z","title":"Sok-bench: A situated video reasoning benchmark with aligned open-world knowledge","venue":null,"work_id":"fd61e611-02ec-405d-bf2d-63f20e823b4b","year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.716606Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:4d677b3af4c28b3695faa199471f7a00725633497459375b3e0a5aabbbe7034a","observation_id":"b934793b-b950-48ce-93e9-5c77b1a3a9c0","resolution":{"observed_at":"2026-08-15T21:59:34.929308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08407","last_updated":"2024-07-30T03:15:55Z","snapshot_observed_at":"2026-08-16T13:43:39.575307Z","submitted_at":"2024-06-12T16:54:54Z","title":"MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08407","snapshot_observed_at":"2026-08-15T21:59:33.721333Z","title":"Mmworld: Towards multi-discipline multi-faceted world model evaluation in videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.721333Z"},"links":{"cited_paper":"/paper/2406.08407","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:507f4ebf66c6b9d1ab03b8d7132d1865873a8048483a2fd1ff7ac9a6c935e74b","observation_id":"fa4837b5-47b0-42d8-8d65-e4e6cd901d7a","resolution":{"observed_at":"2026-08-15T21:59:33.721333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07022","last_updated":"2023-11-13T02:13:13Z","snapshot_observed_at":"2026-08-17T04:39:36.707236Z","submitted_at":"2023-11-13T02:13:13Z","title":"ViLMA: A Zero-Shot Benchmark for Linguistic and Temporal Grounding in Video-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07022","snapshot_observed_at":"2026-08-15T21:59:33.726301Z","title":"Vilma: A zero-shot benchmark for linguistic and temporal grounding in video-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.726301Z"},"links":{"cited_paper":"/paper/2311.07022","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:6f936b31a4d7c9b2f511226e1ea9a02d4d2a8c7c4dfd701749cc14654bc2d33a","observation_id":"d78f15c0-b7e3-4db3-8dc0-380def64992e","resolution":{"observed_at":"2026-08-15T21:59:33.726301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:33.731448Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.731448Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:88f549547e86548c9d3f28fe0f5589822fc546fc6601f9662641470be9b36d28","observation_id":"ac8e6e87-15f4-430c-9521-2b29d9083cbf","resolution":{"observed_at":"2026-08-15T21:59:33.731448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:34.899620Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":"a9835e1a-117a-407c-9b6e-26bdce89aacf","year":2017},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.736464Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:3aa7ce0979cdb253c1b39d8e6d91998878aaee434857f689916a3f6df273af50","observation_id":"8580e34b-d30c-4b28-b1e6-c0848ed85041","resolution":{"observed_at":"2026-08-15T21:59:34.904330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T21:59:33.741587Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.741587Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:c44851ce94d5a8ee4fc11023941df2a72712b043ebd8d93bfab10be8e3296c65","observation_id":"89df4697-23fa-4319-9127-b731d1cc5aac","resolution":{"observed_at":"2026-08-15T21:59:33.741587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T21:59:33.748580Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.748580Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:914b1719d21522418018da40c7b60f09e61c647bf9b4205f6ec0b1022bcfc25f","observation_id":"97814645-f452-4faa-8251-db811fa094db","resolution":{"observed_at":"2026-08-15T21:59:33.748580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-08-16T01:49:22.176843Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-15T21:59:33.753498Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.753498Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:dc19f27212377e45a5075d3d33fee2baf896e6140edceb84e944821a35a92a20","observation_id":"24680908-ecc4-4b80-bf19-e826a679e737","resolution":{"observed_at":"2026-08-15T21:59:33.753498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:34.884566Z","title":"Learning to summarize with human feedback","venue":null,"work_id":"9bf7a93e-61e5-405b-9030-cf1c49491c46","year":2020},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.758432Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:a2d712c65b0731a1dd741769e557eea5a118cf1b1480523bab91cec1f41ef6ac","observation_id":"9e1edf25-7ef5-4916-a861-67fdbd79e8fd","resolution":{"observed_at":"2026-08-15T21:59:34.889209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-15T21:59:33.763413Z","title":"Webgpt: Browser-assisted question-answering with human feedback","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.763413Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:0ecd28a7581a7f59c960f09ce798e16da08453b9cae169556ef9aaad5d2d9fe6","observation_id":"a8c36977-6c37-45b7-9b12-17e04a61dd27","resolution":{"observed_at":"2026-08-15T21:59:33.763413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02406","last_updated":"2023-04-11T19:39:17Z","snapshot_observed_at":"2026-08-15T11:54:04.569366Z","submitted_at":"2022-10-05T17:28:20Z","title":"Decomposed Prompting: A Modular Approach for Solving Complex Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02406","snapshot_observed_at":"2026-08-15T21:59:33.768463Z","title":"Decomposed prompting: A modular approach for solving complex tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.768463Z"},"links":{"cited_paper":"/paper/2210.02406","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:2a0766b84b74753d47469b688b7179dfb1d1f17bb2494e3f60c4a0d69f2cfe81","observation_id":"95e00432-1208-4893-87e9-0d48cb358aa9","resolution":{"observed_at":"2026-08-15T21:59:33.768463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:33.774187Z","title":"Cross-task weakly supervised learning from instructional videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.774187Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:3d54e55e38972fa9e43d1863db41c298f102dce01f6d335a56aeedfa790d948e","observation_id":"7501a49a-7ab1-4c2a-b32f-8c0ba6a17baf","resolution":{"observed_at":"2026-08-15T21:59:33.774187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T21:59:33.779074Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.779074Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:a5abcd24ba5eecdc2ae837a817af931ab6094aba6d4344a78b71648c3b71ab91","observation_id":"bfcfd53b-1f87-4dc8-b886-63934c8076a9","resolution":{"observed_at":"2026-08-15T21:59:33.779074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:34.858085Z","title":"Procedure planning in instructional videos","venue":null,"work_id":"efa7c2b1-34cb-4ace-9140-1f3942dc18ab","year":2020},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.783601Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:9df67bc698aad2da44191828e74e7c038ab314d801372d0d1f2171a93bdc352e","observation_id":"1d7f9d09-8164-4e31-b0ff-cf7cb4912456","resolution":{"observed_at":"2026-08-15T21:59:34.862986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T21:59:33.788339Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.788339Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:d940bc2c0bb2dedefb85a0eb505f378ce7a69f5d01373cc1b3ba53a482f8957d","observation_id":"45816025-77a8-4996-8343-f5f185a6bce3","resolution":{"observed_at":"2026-08-15T21:59:33.788339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-15T21:59:33.793129Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.793129Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:840cb0bf5e8e57f51483b5b91bb63af9c16b4d9b5e859428f15e069e709b2bdd","observation_id":"6b696177-b007-40e3-a160-eb62669a7c28","resolution":{"observed_at":"2026-08-15T21:59:33.793129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T21:59:33.797702Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.797702Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:bc93c6b666331f085c116468a06ad33416578158d66d8846a139456de721b079","observation_id":"ca8f6bae-b1e5-4f52-8979-691d0a85fb06","resolution":{"observed_at":"2026-08-15T21:59:33.797702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:34.842741Z","title":"Identifying and mitigating vulnerabilities in llm-integrated applications","venue":null,"work_id":"1680d1db-d91b-4369-a083-72606f268f03","year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.803407Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:83cc24e7ecbe2ba1464cb22839acca3fce6e5164e489d589e2ec0f5e50bc7fd7","observation_id":"577db0fc-0d97-4733-8a58-afaccc14980c","resolution":{"observed_at":"2026-08-15T21:59:34.847612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-15T21:59:33.808139Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.808139Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:de0d2667781a5fae44841a31d8c7e7cfba987126fea218900da6d3ebb34a1175","observation_id":"cf3fe687-b0a0-444a-87ea-e87f80ecc16e","resolution":{"observed_at":"2026-08-15T21:59:33.808139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-15T21:59:33.812991Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.812991Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:23952d6f85769857e9e40afb944d19f8e40fb29a726d1222e450507df0053e32","observation_id":"047be0b7-5194-461e-9856-6be2066e33e2","resolution":{"observed_at":"2026-08-15T21:59:33.812991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:34.826628Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"d65a041f-886e-4dff-8586-eba695044fc2","year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.817963Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:4a33c6e0b53490b78fa0e8a0d341f75c587725ab7e7a0b2d7106c7c15371272f","observation_id":"de0015e8-0aeb-4867-97b3-f8b93ab7d2bc","resolution":{"observed_at":"2026-08-15T21:59:34.832119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:34.810331Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"3158031f-44eb-41b6-8c03-0e3e6dc33f2b","year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.822529Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:b34e7a6bbda4b3972365137a6089bd7df55dd4b50cb30b7f626d7bed736331c0","observation_id":"5ef27645-4dab-43fc-85a8-edf929a3dbc1","resolution":{"observed_at":"2026-08-15T21:59:34.815963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-15T21:59:33.827196Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.827196Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:8e84af968af035501efb145f2ccc8b84b4dfd72d1a86b9239d353bf57a98944e","observation_id":"faf3c1a1-325b-4625-ae12-0e58912ab2c3","resolution":{"observed_at":"2026-08-15T21:59:33.827196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:34.792896Z","title":"Unmasked teacher: Towards training-efficient video foundation models","venue":null,"work_id":"68fbff69-f727-4104-a3ff-ff830e499b00","year":2023},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.833255Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:842f29cc0ef0c505dcfd783e0d36e5fe46f452fe353f4fa5e3c2d88f290a6825","observation_id":"53afbc61-2f7a-425b-a164-06134bde3f79","resolution":{"observed_at":"2026-08-15T21:59:34.799739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:33.838263Z","title":"Self-alignment of large video language models with refined regularized preference optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.838263Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:6e6a7b0553a9c7fba7d93651ac7c53a8464250fd6725d319a12280737a588ff1","observation_id":"443f75ea-042d-40ab-bbbf-82c5d5f71f07","resolution":{"observed_at":"2026-08-15T21:59:33.838263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-15T21:59:33.842742Z","title":"Nvila: Efficient frontier visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.842742Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:31f261a09de9110c4e3a95f9f9baf79fc5eede9e6096d814dbd034609bd4f25e","observation_id":"e95008de-bb64-4ce2-8fda-886c9f83364d","resolution":{"observed_at":"2026-08-15T21:59:33.842742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-15T21:59:33.848016Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.848016Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:e21d3c0aa3fbe30bf97fc15103ede97f61cb4b87c5d5263491249a813a9e3359","observation_id":"7df600f0-39b1-42a5-8f74-b0b2ab60c761","resolution":{"observed_at":"2026-08-15T21:59:33.848016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-15T21:59:33.853704Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.853704Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:071770b2e8be019220a29eefadb185034502923296ff307682e3b7b54d5a583e","observation_id":"c2d2c112-4f3f-477f-9dd0-beaee1a5d3d4","resolution":{"observed_at":"2026-08-15T21:59:33.853704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:59:35.095619Z","title":null,"venue":null,"work_id":"c518de37-c5f3-4d5a-b2c0-1e080a002b28","year":null},"citing_paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T21:59:33.592973Z"},"links":{"citing_paper":"/paper/2505.08455"},"observation_digest":"sha256:c9d5d035151e76472ad0f35eda13edcf860f7293241fb125e73847bce6772aaa","observation_id":"f3caf5fc-588c-41b9-9866-da8cedf6f0d6","resolution":{"observed_at":"2026-08-15T21:59:35.100239Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.08455","last_updated":"2025-05-13T11:35:58Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T08:00:56.644676Z","submitted_at":"2025-05-13T11:35:58Z","title":"VCRBench: Exploring Long-form Causal Reasoning Capabilities of Large Video Language Models"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":52,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 0 inbound Pith citation observations for arXiv:2505.08455."}