{"as_of":"2026-08-07T17:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a4a49031af7a04d634210eaab882feefb603a47e6d1088c280e4b5381ce4f853","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:45:44.538343Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-23T16:58:12.041594Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.14906","last_updated":"2024-07-15T16:42:22Z","snapshot_observed_at":"2026-08-06T09:24:20.916176Z","submitted_at":"2023-11-25T02:46:12Z","title":"AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering","version":2},"cited_work":{"arxiv_id":"2311.14906","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.14906","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Autoeval-video: An automatic benchmark for assessing large vision language models in open-ended video question answering","venue":null,"work_id":"a448c544-28f6-42bc-a57f-0f0e879ea3b2","year":2023},"citing_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-04T21:17:37.211833Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-17T02:46:16.632743Z"},"links":{"cited_paper":"/paper/2311.14906","citing_paper":"/paper/2403.00476"},"observation_digest":"sha256:49f145372539dcb723d70a2a86750f3668710aa29489645c34178feddf8d1c46","observation_id":"fd508577-b090-436e-8665-a04db08674df","resolution":{"observed_at":"2026-05-17T02:46:16.798635Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14906","last_updated":"2024-07-15T16:42:22Z","snapshot_observed_at":"2026-08-06T09:24:20.916176Z","submitted_at":"2023-11-25T02:46:12Z","title":"AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering","version":2},"cited_work":{"arxiv_id":"2311.14906","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.14906","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Autoeval-video: An automatic benchmark for assessing large vision language models in open-ended video question answering","venue":null,"work_id":"a448c544-28f6-42bc-a57f-0f0e879ea3b2","year":2023},"citing_paper":{"arxiv_id":"2411.16771","last_updated":"2026-04-23T13:21:19Z","snapshot_observed_at":"2026-08-02T03:20:43.405143Z","submitted_at":"2024-11-25T06:17:23Z","title":"VidHal: Benchmarking Temporal Hallucinations in Vision LLMs","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-23T16:57:12.821916Z"},"links":{"cited_paper":"/paper/2311.14906","citing_paper":"/paper/2411.16771"},"observation_digest":"sha256:277b06f3f13b2e5150c1e315a14000489f7c34abff77f4b0d651664b1503180e","observation_id":"6851c591-6483-4e0f-a6fc-f27d274db70f","resolution":{"observed_at":"2026-05-23T16:58:12.044960Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14906","last_updated":"2024-07-15T16:42:22Z","snapshot_observed_at":"2026-08-06T09:24:20.916176Z","submitted_at":"2023-11-25T02:46:12Z","title":"AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering","version":2},"cited_work":{"arxiv_id":"2311.14906","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.14906","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Autoeval-video: An automatic benchmark for assessing large vision language models in open-ended video question answering","venue":null,"work_id":"a448c544-28f6-42bc-a57f-0f0e879ea3b2","year":2023},"citing_paper":{"arxiv_id":"2501.02955","last_updated":"2026-05-12T15:02:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-06T11:57:38Z","title":"MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-23T05:44:31.546843Z"},"links":{"cited_paper":"/paper/2311.14906","citing_paper":"/paper/2501.02955"},"observation_digest":"sha256:36e373fb99f25681d4604a2fcac7e253d3b476e81d9e53af59c1d1ea466af291","observation_id":"4ac5d072-6c4a-4676-a54d-b8366ee7b2da","resolution":{"observed_at":"2026-05-23T05:45:28.290269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14906","last_updated":"2024-07-15T16:42:22Z","snapshot_observed_at":"2026-08-06T09:24:20.916176Z","submitted_at":"2023-11-25T02:46:12Z","title":"AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering","version":2},"cited_work":{"arxiv_id":"2311.14906","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.14906","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Autoeval-video: An automatic benchmark for assessing large vision language models in open-ended video question answering","venue":null,"work_id":"a448c544-28f6-42bc-a57f-0f0e879ea3b2","year":2023},"citing_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T00:32:41.059558Z"},"links":{"cited_paper":"/paper/2311.14906","citing_paper":"/paper/2501.13826"},"observation_digest":"sha256:2b21c1e016571feed499aa96ee7841fc0f2f4cd5d8a29155481c29f69e973344","observation_id":"adcbb1ca-eb72-4683-9220-a3db179f0bc8","resolution":{"observed_at":"2026-05-14T00:32:41.157897Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14906","last_updated":"2024-07-15T16:42:22Z","snapshot_observed_at":"2026-08-06T09:24:20.916176Z","submitted_at":"2023-11-25T02:46:12Z","title":"AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14906","snapshot_observed_at":"2026-08-07T12:45:44.538343Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T14:01:56.505702Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:44.538343Z"},"links":{"cited_paper":"/paper/2311.14906","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:e5d3d845c8e11534f461950f41b6d8ec878d88f71a8bf121c9a94474dd3fe369","observation_id":"48ded090-d928-45ea-8b60-f677fc3e38e5","resolution":{"observed_at":"2026-08-07T12:45:44.538343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14906","last_updated":"2024-07-15T16:42:22Z","snapshot_observed_at":"2026-08-06T09:24:20.916176Z","submitted_at":"2023-11-25T02:46:12Z","title":"AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14906","snapshot_observed_at":"2026-08-06T21:59:15.758936Z","title":"arXiv preprint arXiv:2311.14906","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02946","last_updated":"2025-06-28T15:24:05Z","snapshot_observed_at":"2026-08-06T21:52:26.365788Z","submitted_at":"2025-06-28T15:24:05Z","title":"Iterative Zoom-In: Temporal Interval Exploration for Long Video Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:59:15.758936Z"},"links":{"cited_paper":"/paper/2311.14906","citing_paper":"/paper/2507.02946"},"observation_digest":"sha256:809d65207a2f14690b3fa15bc2ad1626b037defd1156b5851b19ef1f94b35f28","observation_id":"29312749-d544-4313-a39f-c76c0a07fece","resolution":{"observed_at":"2026-08-06T21:59:15.758936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14906","last_updated":"2024-07-15T16:42:22Z","snapshot_observed_at":"2026-08-06T09:24:20.916176Z","submitted_at":"2023-11-25T02:46:12Z","title":"AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14906","snapshot_observed_at":"2026-08-06T17:58:27.085682Z","title":"arXiv preprint arXiv:2311.14906","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09491","last_updated":"2025-07-13T04:44:57Z","snapshot_observed_at":"2026-08-07T08:24:47.947962Z","submitted_at":"2025-07-13T04:44:57Z","title":"GLIMPSE: Do Large Vision-Language Models Truly Think With Videos or Just Glimpse at Them?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:58:27.085682Z"},"links":{"cited_paper":"/paper/2311.14906","citing_paper":"/paper/2507.09491"},"observation_digest":"sha256:b04be5d9d84136a40427b5b409fed24664e1f2bda21e7411193b13ad4aacaac1","observation_id":"d34b630c-e942-4ef4-8a8a-0d5a9c2c5151","resolution":{"observed_at":"2026-08-06T17:58:27.085682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14906","last_updated":"2024-07-15T16:42:22Z","snapshot_observed_at":"2026-08-06T09:24:20.916176Z","submitted_at":"2023-11-25T02:46:12Z","title":"AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14906","snapshot_observed_at":"2026-08-05T22:09:14.941204Z","title":"In Proceedings of the 2022 Conference on Empirical Methods in Natural Language Processing (EMNLP), 5558–5570","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07470","last_updated":"2025-08-21T16:39:49Z","snapshot_observed_at":"2026-08-07T09:50:14.288346Z","submitted_at":"2025-08-10T20:06:42Z","title":"AURA: A Fine-Grained Benchmark and Decomposed Metric for Audio-Visual Reasoning","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T22:09:14.941204Z"},"links":{"cited_paper":"/paper/2311.14906","citing_paper":"/paper/2508.07470"},"observation_digest":"sha256:9f482ca3c6ca1478bb5f8c9aaa8e2d02a37b49599277408a6196a6b0451e79b4","observation_id":"15aa2a3b-5e70-45df-922d-dd1d97003e78","resolution":{"observed_at":"2026-08-05T22:09:14.941204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14906","last_updated":"2024-07-15T16:42:22Z","snapshot_observed_at":"2026-08-06T09:24:20.916176Z","submitted_at":"2023-11-25T02:46:12Z","title":"AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14906","snapshot_observed_at":"2026-08-04T20:20:36.673624Z","title":"Autoeval-video: An automatic benchmark for assessing large vision language models in open-ended video question answering.arXiv preprint arXiv:2311.14906, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08621","last_updated":"2025-09-10T14:17:53Z","snapshot_observed_at":"2026-08-06T13:15:27.312512Z","submitted_at":"2025-09-10T14:17:53Z","title":"AdsQA: Towards Advertisement Video Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T20:20:36.673624Z"},"links":{"cited_paper":"/paper/2311.14906","citing_paper":"/paper/2509.08621"},"observation_digest":"sha256:2462fb61bd0b3748a976261b8476d74e702e53f02c68a4f307dfac77f4fd6058","observation_id":"f00fbaaa-f3e7-4a16-bfad-882965ba957d","resolution":{"observed_at":"2026-08-04T20:20:36.673624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14906","last_updated":"2024-07-15T16:42:22Z","snapshot_observed_at":"2026-08-06T09:24:20.916176Z","submitted_at":"2023-11-25T02:46:12Z","title":"AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering","version":2},"cited_work":{"arxiv_id":"2311.14906","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.14906","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Autoeval-video: An automatic benchmark for assessing large vision language models in open-ended video question answering","venue":null,"work_id":"a448c544-28f6-42bc-a57f-0f0e879ea3b2","year":2023},"citing_paper":{"arxiv_id":"2601.15724","last_updated":"2026-04-19T09:17:00Z","snapshot_observed_at":"2026-08-07T08:54:37.463054Z","submitted_at":"2026-01-22T07:47:29Z","title":"VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T12:17:42.135851Z"},"links":{"cited_paper":"/paper/2311.14906","citing_paper":"/paper/2601.15724"},"observation_digest":"sha256:50fde6a0c23b6826df7e7409dcf54e7b7e6c5634c1558cef68dfeaa5a73a12fa","observation_id":"cd3f0892-6c73-48f1-889a-4904043f5d95","resolution":{"observed_at":"2026-05-16T12:17:51.920232Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14906","last_updated":"2024-07-15T16:42:22Z","snapshot_observed_at":"2026-08-06T09:24:20.916176Z","submitted_at":"2023-11-25T02:46:12Z","title":"AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14906","snapshot_observed_at":"2026-07-31T14:47:01.681295Z","title":"AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering , shorttitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28204","last_updated":"2026-07-30T13:43:40Z","snapshot_observed_at":"2026-08-03T00:06:13.350140Z","submitted_at":"2026-07-30T13:43:40Z","title":"Toward Annotation-Efficient Continuous Emotion Arousal Quantification via Group-Level EEG Dynamic Neural Synchrony","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-07-31T14:47:01.681295Z"},"links":{"cited_paper":"/paper/2311.14906","citing_paper":"/paper/2607.28204"},"observation_digest":"sha256:1723dfa910098eafb7497bc96496d857c90e7c084bc6ae8b1df69d7f7d7aa8d2","observation_id":"094e8e61-1e43-49b3-81c5-8f1d23def8a5","resolution":{"observed_at":"2026-07-31T14:47:01.681295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.14906/citation-record","integrity":"/paper/2311.14906/integrity","json":"/paper/2311.14906/citation-record.json","paper":"/paper/2311.14906"},"outbound":[],"paper":{"arxiv_id":"2311.14906","last_updated":"2024-07-15T16:42:22Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T09:24:20.916176Z","submitted_at":"2023-11-25T02:46:12Z","title":"AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2311.14906."}