{"as_of":"2026-08-07T10:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b4b369a229ce7f2114496dc55f2def5fb3cfa207bedab3e35b00e592324bfe83","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-23T17:31:59.030963Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:59:16.530036Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-25T06:10:24.042274Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"cited_work":{"arxiv_id":"2411.02327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.02327","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","venue":"cs.CV","work_id":"5035c092-6aef-41ba-87b9-c71875ffe9f8","year":2024},"citing_paper":{"arxiv_id":"2505.23617","last_updated":"2026-05-10T04:23:42Z","snapshot_observed_at":"2026-08-03T01:40:18.134653Z","submitted_at":"2025-05-29T16:25:35Z","title":"One Trajectory, One Token: Grounded Video Tokenization via Panoptic Sub-object Trajectory","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-19T12:54:31.765909Z"},"links":{"cited_paper":"/paper/2411.02327","citing_paper":"/paper/2505.23617"},"observation_digest":"sha256:5bf61d780762e3ea655127f17c60895d2c8af95a2f53114981f440b39f45ba17","observation_id":"54f950b8-9c35-4a49-b604-db6aed4d3927","resolution":{"observed_at":"2026-05-19T12:57:17.873276Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02327","snapshot_observed_at":"2026-08-06T21:59:16.530036Z","title":"arXiv preprint arXiv:2411.02327","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-06T21:52:26.365788Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:16.530036Z"},"links":{"cited_paper":"/paper/2411.02327","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:0ca50ff6ebcf0c8e805153a1a2d3b2d3cae30d0c2814db58437b5d7554c73668","observation_id":"a2ad6307-3313-41c9-887d-fdf025e90a0e","resolution":{"observed_at":"2026-08-06T21:59:16.530036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02327","snapshot_observed_at":"2026-08-06T15:34:44.444553Z","title":"Ppllava: Varied video se- quence understanding with prompt guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15569","last_updated":"2025-07-21T12:50:49Z","snapshot_observed_at":"2026-08-06T15:26:30.186888Z","submitted_at":"2025-07-21T12:50:49Z","title":"DynImg: Key Frames with Visual Prompts are Good Representation for Multi-Modal Video Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:34:44.444553Z"},"links":{"cited_paper":"/paper/2411.02327","citing_paper":"/paper/2507.15569"},"observation_digest":"sha256:6f73bf79fd1f1723c4cff209f72a71db43232f0865e85297c9f19d22877dcde2","observation_id":"0a00f510-85b7-4864-9be1-0d8183088207","resolution":{"observed_at":"2026-08-06T15:34:44.444553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"cited_work":{"arxiv_id":"2411.02327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.02327","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","venue":"cs.CV","work_id":"5035c092-6aef-41ba-87b9-c71875ffe9f8","year":2024},"citing_paper":{"arxiv_id":"2602.06037","last_updated":"2026-05-01T09:36:02Z","snapshot_observed_at":"2026-07-06T22:44:46.690576Z","submitted_at":"2026-02-05T18:59:32Z","title":"Thinking with Geometry: Active Geometry Integration for Spatial Reasoning","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T06:39:29.010937Z"},"links":{"cited_paper":"/paper/2411.02327","citing_paper":"/paper/2602.06037"},"observation_digest":"sha256:f982d1bf6108d937736b6367097c44aaca93239a9515a5939d9a3b947b79c80d","observation_id":"a91b56c2-f9f7-4d82-87bb-54d86a864abb","resolution":{"observed_at":"2026-05-16T06:40:42.234279Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"cited_work":{"arxiv_id":"2411.02327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.02327","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","venue":"cs.CV","work_id":"5035c092-6aef-41ba-87b9-c71875ffe9f8","year":2024},"citing_paper":{"arxiv_id":"2605.06094","last_updated":"2026-05-22T03:20:58Z","snapshot_observed_at":"2026-08-01T22:07:44.933252Z","submitted_at":"2026-05-07T12:13:15Z","title":"VISD: Enhancing Video Reasoning via Structured Self-Distillation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-08T14:06:27.953376Z"},"links":{"cited_paper":"/paper/2411.02327","citing_paper":"/paper/2605.06094"},"observation_digest":"sha256:af8c07a4758c369379e1f3a9fa9b88b6d590782deceb9490a85724d9d61ed6b9","observation_id":"ba40a180-65e0-4704-a181-399ea7ad7aeb","resolution":{"observed_at":"2026-05-11T18:46:08.634289Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"cited_work":{"arxiv_id":"2411.02327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.02327","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","venue":"cs.CV","work_id":"5035c092-6aef-41ba-87b9-c71875ffe9f8","year":2024},"citing_paper":{"arxiv_id":"2605.06094","last_updated":"2026-05-22T03:20:58Z","snapshot_observed_at":"2026-08-01T22:07:44.933252Z","submitted_at":"2026-05-07T12:13:15Z","title":"VISD: Enhancing Video Reasoning via Structured Self-Distillation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-11T01:49:41.654207Z"},"links":{"cited_paper":"/paper/2411.02327","citing_paper":"/paper/2605.06094"},"observation_digest":"sha256:aac0257de5ca0d22c7d931375aebe8835d6a73141a36ab19454e70131a383e8a","observation_id":"a3650b38-4333-43a9-a53b-26c46d9f4728","resolution":{"observed_at":"2026-05-11T01:50:51.301451Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"cited_work":{"arxiv_id":"2411.02327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.02327","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","venue":"cs.CV","work_id":"5035c092-6aef-41ba-87b9-c71875ffe9f8","year":2024},"citing_paper":{"arxiv_id":"2605.06094","last_updated":"2026-05-22T03:20:58Z","snapshot_observed_at":"2026-08-01T22:07:44.933252Z","submitted_at":"2026-05-07T12:13:15Z","title":"VISD: Enhancing Video Reasoning via Structured Self-Distillation","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T03:35:59.553683Z"},"links":{"cited_paper":"/paper/2411.02327","citing_paper":"/paper/2605.06094"},"observation_digest":"sha256:b5ddeea469bbd45e63f33a2a78b416394f35dab9ecd2b6ccc51ce95f8244fc8a","observation_id":"5b1d1496-031a-4bbc-bb17-c191991d2ca0","resolution":{"observed_at":"2026-05-12T07:11:27.873311Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"cited_work":{"arxiv_id":"2411.02327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.02327","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","venue":"cs.CV","work_id":"5035c092-6aef-41ba-87b9-c71875ffe9f8","year":2024},"citing_paper":{"arxiv_id":"2605.06094","last_updated":"2026-05-22T03:20:58Z","snapshot_observed_at":"2026-08-01T22:07:44.933252Z","submitted_at":"2026-05-07T12:13:15Z","title":"VISD: Enhancing Video Reasoning via Structured Self-Distillation","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-25T06:08:19.956833Z"},"links":{"cited_paper":"/paper/2411.02327","citing_paper":"/paper/2605.06094"},"observation_digest":"sha256:c2afbcde2f7ce3ad2aa8d45cfdade290c931d223be9cef18019833e1eb17ee66","observation_id":"894a8947-ea88-48fa-80a8-fb259b92b349","resolution":{"observed_at":"2026-05-25T06:10:24.055171Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.02327/citation-record","integrity":"/paper/2411.02327/integrity","json":"/paper/2411.02327/citation-record.json","paper":"/paper/2411.02327"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.03746","last_updated":"2024-06-17T08:20:33Z","snapshot_observed_at":"2026-08-05T01:14:27.456064Z","submitted_at":"2024-02-06T06:27:40Z","title":"Tuning Large Multimodal Models for Videos using Reinforcement Learning from AI Feedback","version":3},"cited_work":{"arxiv_id":"2402.03746","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.03746","snapshot_observed_at":"2026-07-01T10:25:41.390707Z","title":"Tuning large multimodal models for videos using reinforcement learning from ai feedback","venue":null,"work_id":"31cb70fc-3046-4c10-854f-f58ce474d6d5","year":2024},"citing_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-23T17:31:59.030963Z"},"links":{"cited_paper":"/paper/2402.03746","citing_paper":"/paper/2411.02327"},"observation_digest":"sha256:597b379e3229d8eeb523c524ce3759948f1fa2228da5b02c79d8741ca97f58d9","observation_id":"6b7a964c-7182-4033-8d99-3d38e54cd72c","resolution":{"observed_at":"2026-05-23T17:33:15.688660Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-23T17:31:59.030963Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2411.02327"},"observation_digest":"sha256:9761835416e748ddbb3b0577ca3b9722d8e4d2643db2dde4ceca442223d36acd","observation_id":"0709323d-2412-477a-83f5-52e1cc6e9a92","resolution":{"observed_at":"2026-05-23T17:33:15.683478Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":"2404.16821","doi":"10.48550/arxiv.2404.16821","metadata_source":"pith","pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","venue":"cs.CV","work_id":"3714835e-c5a6-4d7e-950c-be44670ed9e6","year":2024},"citing_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-23T17:31:59.030963Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2411.02327"},"observation_digest":"sha256:e6b210b7eff3b934fca3d52adf398b2546aaac9bc86cbbb957710d6611c57a7f","observation_id":"c00ffd46-e694-4b32-ae1e-7efc539b6ac1","resolution":{"observed_at":"2026-05-23T17:33:15.645235Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instructblip: towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"a6decdb0-fce3-46a9-9048-4290fbd6410c","year":2023},"citing_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-23T17:31:59.030963Z"},"links":{"citing_paper":"/paper/2411.02327"},"observation_digest":"sha256:ee56284de439db315d34d0fcbfb9145dc71aff4174e4d75a9fc84325dc032912","observation_id":"a9c0f558-4d9f-4e83-9ba7-53a353b33657","resolution":{"observed_at":"2026-05-23T17:33:16.615806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":"2405.21075","doi":"10.1609/icwsm.v17i1.22209","metadata_source":"pith","pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","venue":"cs.CV","work_id":"77fd5ac9-ae98-4846-9d83-e9c73c8f2a52","year":2024},"citing_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-23T17:31:59.030963Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2411.02327"},"observation_digest":"sha256:51cb9db2c513665ed986282db7fb098c863f4b242479bfc4823f2ddc2ee7dbbe","observation_id":"42a13d49-e85f-4e53-b8bd-dd7c2fd2682a","resolution":{"observed_at":"2026-05-23T17:33:15.678252Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18445","last_updated":"2023-11-30T10:49:56Z","snapshot_observed_at":"2026-08-06T04:44:45.537021Z","submitted_at":"2023-11-30T10:49:56Z","title":"VTimeLLM: Empower LLM to Grasp Video Moments","version":1},"cited_work":{"arxiv_id":"2311.18445","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.18445","snapshot_observed_at":"2026-07-01T08:45:34.766676Z","title":"Vtimellm: Empower llm to grasp video moments","venue":null,"work_id":"7484a96d-058a-496d-9c63-13e4481d6e47","year":2023},"citing_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T17:31:59.030963Z"},"links":{"cited_paper":"/paper/2311.18445","citing_paper":"/paper/2411.02327"},"observation_digest":"sha256:be25a4cd03a202c2eeac2f0e4d7a6b098c1c57f1450184094ae8590d245738b4","observation_id":"e2794c98-6dde-432a-abc5-45cdba567235","resolution":{"observed_at":"2026-05-23T17:33:15.634988Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08046","last_updated":"2024-04-05T15:21:09Z","snapshot_observed_at":"2026-07-06T16:47:17.136168Z","submitted_at":"2023-11-14T10:11:36Z","title":"Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding","version":3},"cited_work":{"arxiv_id":"2311.08046","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08046","snapshot_observed_at":"2026-07-02T16:07:09.229084Z","title":"Chat-univi: Unified vi- sual representation empowers large language models with image and video understanding","venue":null,"work_id":"4702aaae-3849-4e6b-9d23-b744d2f31d03","year":2023},"citing_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-23T17:31:59.030963Z"},"links":{"cited_paper":"/paper/2311.08046","citing_paper":"/paper/2411.02327"},"observation_digest":"sha256:aec30b0cf100255ea2a0476bdcc5a7c285c187192a573ed6b3951874fbe45e1d","observation_id":"11e849b7-9432-467b-b9d8-f9d404e0e492","resolution":{"observed_at":"2026-05-23T17:33:15.629641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-07-06T05:43:22.028213Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":"1705.06950","doi":null,"metadata_source":"pith","pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-07-09T11:16:11.423695Z","title":"The Kinetics Human Action Video Dataset","venue":"cs.CV","work_id":"c8a3de61-cfd3-4aeb-bcf7-a0372c015748","year":2017},"citing_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-23T17:31:59.030963Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2411.02327"},"observation_digest":"sha256:e85537d6d78161b8a995fc0cfa47ce696bc6f0ddf8050e2702c110448fa597ef","observation_id":"c674f23e-cc95-4b6d-aa9d-0f395eaddf1e","resolution":{"observed_at":"2026-05-23T17:33:15.660977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.07895","doi":"10.48550/arxiv.2407.07895","metadata_source":"pith","pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","venue":"cs.CV","work_id":"746ec475-051a-45ef-a6ed-2de8118466e4","year":2024},"citing_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-23T17:31:59.030963Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2411.02327"},"observation_digest":"sha256:2ba6055e9b5db71a5a4ee48b50ef8a52e1cb0ee1d883b4d5f2431bcc8870b366","observation_id":"9512c314-7c3b-47c8-b3c5-fdfe3c0b33bc","resolution":{"observed_at":"2026-05-23T17:33:15.639650Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":"2301.12597","doi":"10.48550/arxiv.2301.12597","metadata_source":"pith","pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","venue":"cs.CV","work_id":"63d03f4d-15f4-4583-8286-913c19f02294","year":2023},"citing_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-23T17:31:59.030963Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2411.02327"},"observation_digest":"sha256:b96bb0abca906cfdbf704d5c981c9a60e21c40f40a4e7bad134ab451f90c7772","observation_id":"7eb635f6-8a01-4dee-9ed7-66b4293a8751","resolution":{"observed_at":"2026-05-23T17:33:15.655629Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2304.08485","doi":"10.48550/arxiv.2304.08485","metadata_source":"pith","pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual Instruction Tuning","venue":"cs.CV","work_id":"68be622d-a6dc-4a13-82de-e3054a3dc509","year":2023},"citing_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-23T17:31:59.030963Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2411.02327"},"observation_digest":"sha256:556521c261db79773f45532f8137b7cc5687722eb6ae41bf44e5c12ee42d2f28","observation_id":"b1642530-20a1-405b-b95c-0c4ab130da09","resolution":{"observed_at":"2026-05-23T17:33:15.666100Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:44.742124+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:44.742124+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07207","last_updated":"2025-03-17T13:51:51Z","snapshot_observed_at":"2026-07-06T15:41:39.660811Z","submitted_at":"2023-06-12T16:11:10Z","title":"Valley: Video Assistant with Large Language model Enhanced abilitY","version":3},"cited_work":{"arxiv_id":"2306.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.07207","snapshot_observed_at":"2026-07-04T19:20:06.409899Z","title":"Valley: Video assistant with large language model enhanced ability.arXiv preprint arXiv:2306.07207","venue":null,"work_id":"fdbffcd9-bed8-44ab-9171-37dea2a6f095","year":2023},"citing_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T17:31:59.030963Z"},"links":{"cited_paper":"/paper/2306.07207","citing_paper":"/paper/2411.02327"},"observation_digest":"sha256:ff1e918c7275afa629e183c5765fb523c8f9231877f8fbec7ac276435eef0140","observation_id":"dc8993eb-df65-4539-8b6b-4bd24028e0e2","resolution":{"observed_at":"2026-05-23T17:33:15.706077Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":"2306.05424","doi":"10.48550/arxiv.2306.05424","metadata_source":"pith","pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","venue":"cs.CV","work_id":"51f627f4-8fae-4882-a3e9-abdf932ef27b","year":2023},"citing_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-23T17:31:59.030963Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2411.02327"},"observation_digest":"sha256:7a3eace162b18c12e377ea159ceff80cad09bef6dd52d738575497c3bff947a2","observation_id":"0f5d6a4b-5ef7-445b-ba7e-d036c0bcd49f","resolution":{"observed_at":"2026-05-23T17:33:15.711594Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07111","last_updated":"2022-03-14T13:55:33Z","snapshot_observed_at":"2026-08-06T20:50:04.667147Z","submitted_at":"2022-03-14T13:55:33Z","title":"Disentangled Representation Learning for Text-Video Retrieval","version":1},"cited_work":{"arxiv_id":"2203.07111","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.07111","snapshot_observed_at":"2026-07-02T14:27:03.001260Z","title":"Disentangled representa- tion learning for text-video retrieval","venue":null,"work_id":"e70665a4-97a9-4b93-b221-7f470191c22f","year":2022},"citing_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-23T17:31:59.030963Z"},"links":{"cited_paper":"/paper/2203.07111","citing_paper":"/paper/2411.02327"},"observation_digest":"sha256:0dc37e818adeada91abc2b37b0241dc8ffbeb8472fa43ee35b0f8cc6098a82f1","observation_id":"82efa17d-1292-46ee-ad95-f8bcdd83b5ca","resolution":{"observed_at":"2026-05-23T17:33:15.650502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":"2404.16994","doi":"10.48550/arxiv.2404.16994","metadata_source":"pith","pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","venue":"cs.CV","work_id":"8949d4db-20f2-47c1-83a6-fcbe041b62ef","year":2024},"citing_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-23T17:31:59.030963Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2411.02327"},"observation_digest":"sha256:2e38af04ec79908025ac999c7f6684523dde2ea5d47602daa0b5d241b711a4e0","observation_id":"ac24b98d-7588-4608-a5a6-f4da5a267dfc","resolution":{"observed_at":"2026-05-23T17:33:15.699217Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2408.08872","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T23:26:36.941385Z","title":"xgen-mm (blip-3): A family of open large multimodal models","venue":null,"work_id":"cbbbedfe-4a1d-41b9-858e-635d92930981","year":2024},"citing_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-23T17:31:59.030963Z"},"links":{"citing_paper":"/paper/2411.02327"},"observation_digest":"sha256:9cd10ccd348ef920bc487e5c61424630502739720984484738572cf1a8b2643a","observation_id":"0ab69d3a-edc3-4c0e-9fa9-4e7915dcf147","resolution":{"observed_at":"2026-05-23T17:33:15.694290Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04640","last_updated":"2024-03-07T16:31:02Z","snapshot_observed_at":"2026-08-03T18:43:24.966971Z","submitted_at":"2024-03-07T16:31:02Z","title":"CAT: Enhancing Multimodal Large Language Model to Answer Questions in Dynamic Audio-Visual Scenarios","version":1},"cited_work":{"arxiv_id":"2403.04640","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04640","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cat: enhancing multimodal large language model to answer questions in dynamic audio-visual scenarios","venue":null,"work_id":"aa6669f8-0c40-4da1-bfc1-724471536276","year":2024},"citing_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-23T17:31:59.030963Z"},"links":{"cited_paper":"/paper/2403.04640","citing_paper":"/paper/2411.02327"},"observation_digest":"sha256:c551a3bd5c19950a26829fb7711187a190ba07540cc8eb503e239505068f11ef","observation_id":"a37cdb24-04e9-4629-941b-eb8447461fd4","resolution":{"observed_at":"2026-05-23T17:33:15.721769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01442","last_updated":"2020-03-08T00:09:07Z","snapshot_observed_at":"2026-07-06T08:26:38.349660Z","submitted_at":"2019-10-03T13:16:36Z","title":"CLEVRER: CoLlision Events for Video REpresentation and Reasoning","version":2},"cited_work":{"arxiv_id":"1910.01442","doi":"10.48550/arxiv.1910.01442","metadata_source":"pith","pith_arxiv_id":"1910.01442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CLEVRER: CoLlision Events for Video REpresentation and Reasoning","venue":"cs.CV","work_id":"595fdbf7-89d5-4593-8f57-24e8b469a43c","year":2019},"citing_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-23T17:31:59.030963Z"},"links":{"cited_paper":"/paper/1910.01442","citing_paper":"/paper/2411.02327"},"observation_digest":"sha256:1ef5e212fac30abbd15c67b383cf2fd6141bb826f026d91e401b35a2ac6fbc23","observation_id":"50c3b1a7-8470-40c9-9e15-4a369b372166","resolution":{"observed_at":"2026-05-23T17:33:15.726334Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-23T20:53:53.698369+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T20:53:53.698369+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":"2306.02858","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-07-04T16:29:57.761121Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","venue":"cs.CL","work_id":"555cf04a-49a7-44b8-9019-a83ce85ace95","year":2023},"citing_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T17:31:59.030963Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2411.02327"},"observation_digest":"sha256:73655e887d75025ac0f6c0c0d84ee27225a0de036f0abdd0f8713dd9e22ddb0c","observation_id":"fa9c9685-13da-4874-b1b9-c8ad5fc4ef16","resolution":{"observed_at":"2026-05-23T17:33:15.716201Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08085","last_updated":"2024-06-30T05:39:46Z","snapshot_observed_at":"2026-08-03T12:09:02.990658Z","submitted_at":"2024-06-12T11:07:55Z","title":"Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams","version":2},"cited_work":{"arxiv_id":"2406.08085","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08085","snapshot_observed_at":"2026-07-04T20:00:08.182505Z","title":"Flash-vstream: Memory-based real-time understanding for long video streams","venue":null,"work_id":"f53e5fea-3444-480b-aa38-be98378c0ced","year":2024},"citing_paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-23T17:31:59.030963Z"},"links":{"cited_paper":"/paper/2406.08085","citing_paper":"/paper/2411.02327"},"observation_digest":"sha256:b271a3d78e1c5519f0edd2163147f61e03eb5e2151dc0bb63fbd5139bcd63cff","observation_id":"fed152d1-acea-4a91-8536-678bbe328e50","resolution":{"observed_at":"2026-05-23T17:33:15.672665Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.02327","last_updated":"2026-05-01T17:44:24Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:50:36Z","title":"PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":19,"verified_fuzzy":1},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 8 inbound Pith citation observations for arXiv:2411.02327."}