{"as_of":"2026-08-08T09:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c12bb27faaa93aaa05b563488e06dcb324da58b4201822b77f5c00c435cb245a","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:45:50.619699Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T14:51:33.951351Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T22:56:20.413167Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"cited_work":{"arxiv_id":"2505.23693","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23693","snapshot_observed_at":"2026-07-01T22:56:20.413167Z","title":"Vf-eval: Evaluating multimodal llms for generating feedback on aigc videos.arXiv preprint arXiv:2505.23693, 2025","venue":null,"work_id":"bff531aa-b5da-43bf-a09c-3977dad71a4e","year":2025},"citing_paper":{"arxiv_id":"2606.01897","last_updated":"2026-06-04T06:48:12Z","snapshot_observed_at":"2026-08-03T01:08:05.022167Z","submitted_at":"2026-06-01T08:38:39Z","title":"Community-Aware Assessment of Social Textual Engagement and Resonance: A Human-Centric Perspective on User-Generated Content Evaluation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T14:51:33.951351Z"},"links":{"cited_paper":"/paper/2505.23693","citing_paper":"/paper/2606.01897"},"observation_digest":"sha256:8549d7946031e3cc100a615ceb3daa4f24266ae0a9fca86980f5116d481c6023","observation_id":"eb3d2990-9dde-45f9-a425-9dcaa0fb0205","resolution":{"observed_at":"2026-07-01T22:56:20.415369Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23693/citation-record","integrity":"/paper/2505.23693/integrity","json":"/paper/2505.23693/citation-record.json","paper":"/paper/2505.23693"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:43.741569Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:43.741569Z"},"links":{"citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:951e69d448e646abf75f25f5c3f0213213797b0f74073216203f1802bc2947d3","observation_id":"e62cd0b2-3720-49ec-8dea-00813429eb42","resolution":{"observed_at":"2026-08-07T12:45:43.741569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:43.846912Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:43.846912Z"},"links":{"citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:f04331a719e327637c766b7881329ab1a01f0c5f6c3d0caad3b3a2061a45cfdf","observation_id":"e3ec7d4b-9381-4207-8114-bb0c96a8d985","resolution":{"observed_at":"2026-08-07T12:45:43.846912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T12:45:43.962180Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:43.962180Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:211b34784450f429769d4430202bd2cd1b6fb37ee8c01371651d14b7ba882dea","observation_id":"3d689502-d095-41c7-a03b-c2b128bf3b9f","resolution":{"observed_at":"2026-08-07T12:45:43.962180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T12:45:44.067256Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:44.067256Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:68626268a61d80097649b4ac4567e7a6bbd1e0c818dd69d4de90aaa0bfd5c2d8","observation_id":"533b0339-a776-4d3c-8466-f712a75eaeb6","resolution":{"observed_at":"2026-08-07T12:45:44.067256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03520","last_updated":"2024-10-03T17:24:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T17:53:55Z","title":"VideoPhy: Evaluating Physical Commonsense for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03520","snapshot_observed_at":"2026-08-07T12:45:44.170543Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:44.170543Z"},"links":{"cited_paper":"/paper/2406.03520","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:9ef7c0ded9399b2ee8ce8d670ee4e668a2681ec9c55693fba7370c98cc320f8d","observation_id":"abf7a0ea-213f-4d0d-87c1-6d9500376319","resolution":{"observed_at":"2026-08-07T12:45:44.170543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-07T14:02:24.188094Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"cited_work":{"arxiv_id":"2412.03665","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03665","snapshot_observed_at":"2026-08-07T12:45:52.393487Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","venue":"cs.CV","work_id":"295c9fb1-d9c1-452b-a8d2-b1d46de1401b","year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:44.316344Z"},"links":{"cited_paper":"/paper/2412.03665","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:6d527d7652b37e2c5396660bab5730e6e747b5482c4d46bd3c4123b3c682198f","observation_id":"939add0e-cde7-4d97-a8f7-4d8a88594e64","resolution":{"observed_at":"2026-08-07T12:45:52.476729Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19392","last_updated":"2024-07-02T15:30:03Z","snapshot_observed_at":"2026-08-02T12:22:52.096368Z","submitted_at":"2024-06-27T17:59:45Z","title":"ReXTime: A Benchmark Suite for Reasoning-Across-Time in Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19392","snapshot_observed_at":"2026-08-07T12:45:44.438501Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:44.438501Z"},"links":{"cited_paper":"/paper/2406.19392","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:b79d06b23a1fe5391787e6d2f86dc0212c1d258d32b98267188e42ad95c86eb1","observation_id":"5872b0d7-1f29-43f8-805d-5331c4a711d8","resolution":{"observed_at":"2026-08-07T12:45:44.438501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14906","last_updated":"2024-07-15T16:42:22Z","snapshot_observed_at":"2026-08-06T09:24:20.916176Z","submitted_at":"2023-11-25T02:46:12Z","title":"AutoEval-Video: An Automatic Benchmark for Assessing Large Vision Language Models in Open-Ended Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14906","snapshot_observed_at":"2026-08-07T12:45:44.538343Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:44.538343Z"},"links":{"cited_paper":"/paper/2311.14906","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:c745092a47d41b377dcf049ede705df9ad5d4bde6bf7e1f44ec9e1c9aadd713e","observation_id":"48ded090-d928-45ea-8b60-f677fc3e38e5","resolution":{"observed_at":"2026-08-07T12:45:44.538343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T12:45:44.679138Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:44.679138Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:b99ea289e156a19d15d4c6e3a7575589a6fca2fdb85e73a6f558e9847e21daec","observation_id":"931fd778-7db9-4656-9d6d-7386d5d7549f","resolution":{"observed_at":"2026-08-07T12:45:44.679138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01651","last_updated":"2024-01-23T15:31:17Z","snapshot_observed_at":"2026-07-06T17:11:09.611305Z","submitted_at":"2024-01-03T10:08:40Z","title":"AIGCBench: Comprehensive Evaluation of Image-to-Video Content Generated by AI","version":3},"cited_work":{"arxiv_id":"2401.01651","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.01651","snapshot_observed_at":"2026-08-07T12:45:52.168265Z","title":"AIGCBench: Comprehensive Evaluation of Image-to-Video Content Generated by AI","venue":"cs.CV","work_id":"330f3e43-2daf-417e-bccb-b25bdb8a4032","year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:44.801085Z"},"links":{"cited_paper":"/paper/2401.01651","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:31c7c65a9e7cb558fbff3691a1daf9fcadf77d19fdb349fa84756c67bfa4218b","observation_id":"3000991f-59c4-4821-afbc-381b73476d7a","resolution":{"observed_at":"2026-08-07T12:45:52.259109Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14515","last_updated":"2024-10-30T13:38:10Z","snapshot_observed_at":"2026-07-06T18:34:24.078145Z","submitted_at":"2024-06-20T17:26:01Z","title":"MMBench-Video: A Long-Form Multi-Shot Benchmark for Holistic Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14515","snapshot_observed_at":"2026-08-07T12:45:44.920605Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:44.920605Z"},"links":{"cited_paper":"/paper/2406.14515","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:e8d7f15627320518f9de2a08d4961becb7fecd28e57782520a035914e96bf3bf","observation_id":"2b773435-f45d-44d3-a2a5-28ef34363b23","resolution":{"observed_at":"2026-08-07T12:45:44.920605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T12:45:45.015168Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:45.015168Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:e8b5bc62f56e9f135edad9fabce5362712ab130951af857a7a38fc09f91c83ac","observation_id":"6db424d1-fead-4382-9b1b-eaac116a4e15","resolution":{"observed_at":"2026-08-07T12:45:45.015168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14008","last_updated":"2024-08-26T04:29:52Z","snapshot_observed_at":"2026-08-01T15:29:43.525087Z","submitted_at":"2024-08-26T04:29:52Z","title":"LMM-VQA: Advancing Video Quality Assessment with Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14008","snapshot_observed_at":"2026-08-07T12:45:45.113785Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:45.113785Z"},"links":{"cited_paper":"/paper/2408.14008","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:fd381ccd9b9fa3394d859b4bd4080d7fa0bd4a8cef9c34717efa4db2168e8e31","observation_id":"c70e6167-669e-4b4c-a7cd-9d330fad562b","resolution":{"observed_at":"2026-08-07T12:45:45.113785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07270","last_updated":"2024-05-05T20:34:28Z","snapshot_observed_at":"2026-08-07T17:45:50.717841Z","submitted_at":"2024-02-11T18:26:18Z","title":"Open-ended VQA benchmarking of Vision-Language models by exploiting Classification datasets and their semantic hierarchy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07270","snapshot_observed_at":"2026-08-07T12:45:45.265067Z","title":"Bravo, and Thomas Brox","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:45.265067Z"},"links":{"cited_paper":"/paper/2402.07270","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:ad801d3f918b143c95409cfc7095f2140cc026d1f536a2a920ad34e8e23f8efb","observation_id":"2c6f8ff8-ad4f-4412-a6ae-31560ec03131","resolution":{"observed_at":"2026-08-07T12:45:45.265067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-07T13:56:34.167869Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-07T12:45:45.379677Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:45.379677Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:244ca5b0460d078ff6fb6296e1ba1a46da03b04e14c07a0a14f3f7a22a6f849d","observation_id":"e3340e9e-7745-407d-bb4a-6f16a6251130","resolution":{"observed_at":"2026-08-07T12:45:45.379677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T12:45:45.475594Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:45.475594Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:3ce2cf65703826651810dec40711e41582d3072ccd446b18f3ef2256d7de2e11","observation_id":"957dce73-1c6d-42dc-be04-396c265a6aa9","resolution":{"observed_at":"2026-08-07T12:45:45.475594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:55.324523Z","title":null,"venue":null,"work_id":"8774c78e-0d70-4ee3-81b9-6d10aff4901e","year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:45.622864Z"},"links":{"citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:a85dcfc3051d1023c06be963ceba7c0e4cefea7fa25fc81c70782dc573fce1c9","observation_id":"32257275-7bc1-4355-b316-0d74ce9e0869","resolution":{"observed_at":"2026-08-07T12:45:55.433502Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13926","last_updated":"2025-07-23T16:09:10Z","snapshot_observed_at":"2026-07-06T20:25:08.527025Z","submitted_at":"2025-01-23T18:59:43Z","title":"Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13926","snapshot_observed_at":"2026-08-07T12:45:45.740034Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:45.740034Z"},"links":{"cited_paper":"/paper/2501.13926","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:9923e8fdde756f7d435c7d84e9e8d8de492203dd2f30b005cd3d22d45295ff53","observation_id":"8a0adae8-f90e-48c0-a83b-bca2917ef604","resolution":{"observed_at":"2026-08-07T12:45:45.740034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08407","last_updated":"2024-07-30T03:15:55Z","snapshot_observed_at":"2026-08-03T12:24:31.311692Z","submitted_at":"2024-06-12T16:54:54Z","title":"MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08407","snapshot_observed_at":"2026-08-07T12:45:45.857292Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:45.857292Z"},"links":{"cited_paper":"/paper/2406.08407","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:0fc188dc7e736cdfb55caaa58cc91b6be7addefce6d36386b885500dee95b194","observation_id":"768a3bfd-c353-44fc-8570-88a19169d001","resolution":{"observed_at":"2026-08-07T12:45:45.857292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16435","last_updated":"2026-05-03T19:46:16Z","snapshot_observed_at":"2026-08-01T07:16:47.081829Z","submitted_at":"2025-02-23T04:21:32Z","title":"Human Cognitive Benchmarks Reveal Foundational Visual Gaps in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16435","snapshot_observed_at":"2026-08-07T12:45:45.930805Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:45.930805Z"},"links":{"cited_paper":"/paper/2502.16435","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:e93a841160a376ae08a1b3915990365763964f3328c7508d24be68cdb428d82d","observation_id":"ddb0f8d9-ba86-4eaa-bdb9-be3a7b772af0","resolution":{"observed_at":"2026-08-07T12:45:45.930805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:55.051421Z","title":null,"venue":null,"work_id":"99855dda-ce35-46e5-ba99-01e73f7e6b47","year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:46.024858Z"},"links":{"citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:0fb352806bd65e5e462faa7d26b379f8286945c64545d94cc185b8ea475d8e8a","observation_id":"bdd63013-ba0d-4a87-a072-49ed107d3cec","resolution":{"observed_at":"2026-08-07T12:45:55.208825Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T12:45:46.117617Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:46.117617Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:0d197f17be9f3c549146bf7cc09baef47566987441c6b9ad29d954330c594519","observation_id":"8046bc62-217f-40d9-83c9-4fe1946366d6","resolution":{"observed_at":"2026-08-07T12:45:46.117617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-07T12:45:46.176451Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:46.176451Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:1761c942e195c4cef31ef0039924dac2bc459f1dac7505d0333e6caf3e4e377d","observation_id":"a4d8b984-834c-40af-b9a4-eb29c5ee3c72","resolution":{"observed_at":"2026-08-07T12:45:46.176451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15115","last_updated":"2026-04-20T17:59:36Z","snapshot_observed_at":"2026-08-02T10:06:23.710148Z","submitted_at":"2024-11-22T18:31:47Z","title":"Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15115","snapshot_observed_at":"2026-08-07T12:45:46.236243Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:46.236243Z"},"links":{"cited_paper":"/paper/2411.15115","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:479943f176ab1a3efc7cfc08ca837bc3371881c1f574c85cd272b2867023bdbf","observation_id":"e423f4ba-9fef-4bd5-ac1a-47c6a316cf4e","resolution":{"observed_at":"2026-08-07T12:45:46.236243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T12:45:46.299347Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:46.299347Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:b199049e779047976a210edb43ecafda9c781ad555c3dddbcaca1c645a61ef37","observation_id":"f38dbbaa-c200-4890-8354-1c0c167ceb48","resolution":{"observed_at":"2026-08-07T12:45:46.299347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:46.417128Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:46.417128Z"},"links":{"citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:a82b0e6ea0937b144f0d6d8241fe2702e9bc1924611cc43987c720a2cc45f69e","observation_id":"370c580d-0a04-4306-8fb4-1f918c5537d6","resolution":{"observed_at":"2026-08-07T12:45:46.417128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T12:45:46.512570Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:46.512570Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:8c0fbfc7698e2f4712a1b3f8398b2379d9beee5ca356a392c8cfd1a5ba9fa4b0","observation_id":"cfb42be7-2600-43d1-bc3f-806577ce11ec","resolution":{"observed_at":"2026-08-07T12:45:46.512570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:54.776232Z","title":null,"venue":null,"work_id":"37ac729d-6eef-409a-a2ad-2e3ffcc35152","year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:46.638279Z"},"links":{"citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:590280d7cc79714e1462b6e6cab3ff6479a1fd2e443b85d1c1dd87d6231b9c66","observation_id":"5c3f3fc5-4b05-4dee-a396-5883fe2c7ab8","resolution":{"observed_at":"2026-08-07T12:45:54.892978Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17451","last_updated":"2025-06-02T05:46:18Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:08:34Z","title":"VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17451","snapshot_observed_at":"2026-08-07T12:45:46.762139Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:46.762139Z"},"links":{"cited_paper":"/paper/2411.17451","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:7625068bbe34e58b6c34e20dfd83b8425dae15d7a52f8458b1d4bc795a5e77dc","observation_id":"33b32872-3a47-4d49-9582-00ed23d0e82a","resolution":{"observed_at":"2026-08-07T12:45:46.762139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11303","last_updated":"2024-06-17T08:09:00Z","snapshot_observed_at":"2026-08-04T15:53:11.168523Z","submitted_at":"2024-06-17T08:09:00Z","title":"VideoVista: A Versatile Benchmark for Video Understanding and Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11303","snapshot_observed_at":"2026-08-07T12:45:46.866771Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:46.866771Z"},"links":{"cited_paper":"/paper/2406.11303","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:467cbe87d02b6cc6b989dbeed12a1553183c94b7e4e5d4ca02bed7ea9f8a58c9","observation_id":"f4e62474-1e58-4261-b56c-11dbe3e6481f","resolution":{"observed_at":"2026-08-07T12:45:46.866771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:46.934791Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:46.934791Z"},"links":{"citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:6cfd694fbd87f815d84545b70fd7168a3f1cdda41ad0649b41f8f57f2d92a88f","observation_id":"25a57ab5-a095-4b2e-9d00-571c75d43ef8","resolution":{"observed_at":"2026-08-07T12:45:46.934791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:47.060863Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:47.060863Z"},"links":{"citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:af23c77b4f96698178b3bb872c8530d6ccaf129284364a439e9248393e21150b","observation_id":"8c73fc07-fd34-401a-aeef-2da79402d7d8","resolution":{"observed_at":"2026-08-07T12:45:47.060863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:54.529348Z","title":null,"venue":null,"work_id":"4fdf376d-9820-4ea7-9eb6-3a71ab0ec4a1","year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:47.143106Z"},"links":{"citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:fb843932f9d20aefc202877c3eec5a648494c43a60b23b1fbc561340c740bb0b","observation_id":"9d3921b0-67c6-460d-a225-b6484f7a61fd","resolution":{"observed_at":"2026-08-07T12:45:54.647025Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:54.271465Z","title":null,"venue":null,"work_id":"a3654e8d-496c-499f-8fda-f83b9069f6ea","year":2023},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:47.209808Z"},"links":{"citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:e9d7345658fbceda73dd718f412704c9d27c5efcf5c2026a817ecca986a1de13","observation_id":"da49f215-98c6-4595-9b16-c524a000d953","resolution":{"observed_at":"2026-08-07T12:45:54.420036Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-04T21:17:37.211833Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-08-07T12:45:47.315409Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:47.315409Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:b33001bf0c8a07841744f31ac8b9eacf416aa7d59bcbc1ff31183e38f36e6bac","observation_id":"c8a1f739-ef73-45c0-ab0a-7aa86a36405f","resolution":{"observed_at":"2026-08-07T12:45:47.315409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-07-06T15:42:56.285045Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-07T12:45:47.443705Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:47.443705Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:0eb9a63d64bb1c109384b56cb7b612e0125ab87852b665fc8c057e48eea31588","observation_id":"e30ebd95-91dd-4632-90e8-d9560d30dc93","resolution":{"observed_at":"2026-08-07T12:45:47.443705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05363","last_updated":"2024-10-07T17:56:04Z","snapshot_observed_at":"2026-07-06T19:29:14.335016Z","submitted_at":"2024-10-07T17:56:04Z","title":"Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05363","snapshot_observed_at":"2026-08-07T12:45:47.596974Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:47.596974Z"},"links":{"cited_paper":"/paper/2410.05363","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:a9c1761d5db739aba7e76cf9268080286d7893ff57053afd1ca438903613c113","observation_id":"39f30c25-7fce-4277-af82-32f295dca67d","resolution":{"observed_at":"2026-08-07T12:45:47.596974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:54.084925Z","title":null,"venue":null,"work_id":"46509ea7-3877-4385-b94e-f423b5d428b7","year":2025},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:47.719458Z"},"links":{"citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:656313f636d3343c9f15944548afeaecaffbf101a3fd02704bb3e008e1f14eba","observation_id":"061ae997-6995-458a-a16a-dfbbb2036e48","resolution":{"observed_at":"2026-08-07T12:45:54.169749Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16103","last_updated":"2023-11-28T18:16:29Z","snapshot_observed_at":"2026-08-05T15:15:57.768787Z","submitted_at":"2023-11-27T18:59:58Z","title":"Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16103","snapshot_observed_at":"2026-08-07T12:45:47.827826Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:47.827826Z"},"links":{"cited_paper":"/paper/2311.16103","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:9129dc452c0849bcb2025d60a422b0ffe5387fc0622e46231928194a017b3f2c","observation_id":"e79e1b7e-d904-4d9e-bac3-d687bd900045","resolution":{"observed_at":"2026-08-07T12:45:47.827826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:45:47.934620Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:47.934620Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:16289d6b3a4cdb45c526b46cbb37937f292a1a07912efe1b94d5739e3912a035","observation_id":"c56c653a-e8bf-4d33-b1b4-46ccdbe8278c","resolution":{"observed_at":"2026-08-07T12:45:47.934620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13573","last_updated":"2024-04-27T15:10:55Z","snapshot_observed_at":"2026-07-06T18:03:15.097118Z","submitted_at":"2024-04-21T08:27:20Z","title":"Exploring AIGC Video Quality: A Focus on Visual Harmony, Video-Text Consistency and Domain Distribution Gap","version":2},"cited_work":{"arxiv_id":"2404.13573","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.13573","snapshot_observed_at":"2026-08-07T12:45:51.627735Z","title":"Exploring AIGC Video Quality: A Focus on Visual Harmony, Video-Text Consistency and Domain Distribution Gap","venue":"cs.CV","work_id":"7f9a3d2b-16f8-431b-870e-fcfea8ac4ae4","year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:48.041458Z"},"links":{"cited_paper":"/paper/2404.13573","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:9f867cccbc2a082fd43a28edad5d337d768b488f85b3f1b8eb73e820588178ca","observation_id":"8fded728-4d52-4a7c-a247-77c5221686b7","resolution":{"observed_at":"2026-08-07T12:45:51.709687Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:53.885696Z","title":null,"venue":null,"work_id":"96a49a38-1984-4f85-b259-edf72154f547","year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:48.154875Z"},"links":{"citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:fd8641170b9267666c475cf6f36f6fcd98ecfa507d1aa54558b009bf7894935c","observation_id":"c5774b23-4dd8-4aa4-87d0-f249c70fb3ba","resolution":{"observed_at":"2026-08-07T12:45:53.980201Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23266","last_updated":"2025-08-25T17:57:34Z","snapshot_observed_at":"2026-07-06T19:42:25.742756Z","submitted_at":"2024-10-30T17:50:23Z","title":"TOMATO: Assessing Visual Temporal Reasoning Capabilities in Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23266","snapshot_observed_at":"2026-08-07T12:45:48.261199Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:48.261199Z"},"links":{"cited_paper":"/paper/2410.23266","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:d820227d847314672176841b2e14c29c497e8af8ab5e7d6bca0985664b0b31db","observation_id":"51d896f8-66df-4027-9c6e-e48beb66ab3b","resolution":{"observed_at":"2026-08-07T12:45:48.261199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:53.556331Z","title":"2020-2024","venue":null,"work_id":"ecd95da3-276c-4504-8459-c7284f96fbb5","year":2020},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:48.386238Z"},"links":{"citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:5c50083e15b0db898dd378e3f6dffb65b8d20fc2a012e26fbc14afa4a9beba5b","observation_id":"1d1b9025-dfa8-4623-ab78-e404bc7a46e3","resolution":{"observed_at":"2026-08-07T12:45:53.658856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:48.502389Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:48.502389Z"},"links":{"citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:53b6de6ebfe134288da58f86ad5f1965b835ecea11f74eb94ab02af52069ab13","observation_id":"ed4ca545-399d-4284-9814-4c6876c2381b","resolution":{"observed_at":"2026-08-07T12:45:48.502389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:53.346753Z","title":null,"venue":null,"work_id":"7bb9e2eb-5f68-430b-b1ef-8cbd0bd2bd86","year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:48.635380Z"},"links":{"citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:41f2cad6a5119033efb5062221e0c8e90ddd88d6d2f127ae8f278adadfeb5d72","observation_id":"9692c2c6-a8e4-4a3b-9d0d-22b165b52e3c","resolution":{"observed_at":"2026-08-07T12:45:53.451589Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04161","last_updated":"2024-11-04T02:52:56Z","snapshot_observed_at":"2026-08-06T04:30:13.850896Z","submitted_at":"2023-05-07T02:26:00Z","title":"Camera-Based HRV Prediction for Remote Learning Environments","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04161","snapshot_observed_at":"2026-08-07T12:45:48.781522Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:48.781522Z"},"links":{"cited_paper":"/paper/2305.04161","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:5be36dfed14773901a339a125cdd120f3c99c3ab46808f825921412842e1b98a","observation_id":"bd778fa0-cc31-4ff2-af7b-a704eecad666","resolution":{"observed_at":"2026-08-07T12:45:48.781522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T12:45:48.866290Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:48.866290Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:0133efe10c99c3ed421e1c62f78da10eb56d5d82f7be8a4d4863ac8ed57c394e","observation_id":"abc5d636-b7bd-4bfe-af42-a838d218fe02","resolution":{"observed_at":"2026-08-07T12:45:48.866290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-07T12:45:48.950196Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:48.950196Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:6a6f752ae874a483d5cb0858c102f0bf1f6394e93f37716a3c5afeea9818b128","observation_id":"7e315a08-adef-4e27-bc2d-17cfe2d36839","resolution":{"observed_at":"2026-08-07T12:45:48.950196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-08-07T12:45:49.003746Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:49.003746Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:f8b0c048a616d4a07c440570eace501740b46cb572721debf86e191fba8b88f7","observation_id":"d1939357-4ace-45e9-b8e8-8547e57afecb","resolution":{"observed_at":"2026-08-07T12:45:49.003746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16511","last_updated":"2024-10-27T15:20:03Z","snapshot_observed_at":"2026-07-06T16:53:35.776613Z","submitted_at":"2023-11-25T04:05:59Z","title":"GPT4Video: A Unified Multimodal Large Language Model for lnstruction-Followed Understanding and Safety-Aware Generation","version":2},"cited_work":{"arxiv_id":"2311.16511","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.16511","snapshot_observed_at":"2026-08-07T12:45:51.322649Z","title":"GPT4Video: A Unified Multimodal Large Language Model for lnstruction-Followed Understanding and Safety-Aware Generation","venue":"cs.CV","work_id":"2257ab0e-c8ac-41e0-882a-7b90293f0396","year":2023},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:49.068917Z"},"links":{"cited_paper":"/paper/2311.16511","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:bf0788316f6a54aab59b93b440570f0300c28fcc1615de109e7246006e4c75d7","observation_id":"01ef8c20-4f38-45d4-ac7f-d997d7992b77","resolution":{"observed_at":"2026-08-07T12:45:51.382028Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14181","last_updated":"2024-01-01T14:48:48Z","snapshot_observed_at":"2026-07-06T16:23:18.453624Z","submitted_at":"2023-09-25T14:43:43Z","title":"Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14181","snapshot_observed_at":"2026-08-07T12:45:49.132169Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:49.132169Z"},"links":{"cited_paper":"/paper/2309.14181","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:3c450e0d9500d52188932d1eecdbc9125012271c6e5324f0159147bd335036e0","observation_id":"f020b70c-87f6-44bb-9d4e-21811f81ec82","resolution":{"observed_at":"2026-08-07T12:45:49.132169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17090","last_updated":"2023-12-28T16:10:25Z","snapshot_observed_at":"2026-08-02T07:14:02.308302Z","submitted_at":"2023-12-28T16:10:25Z","title":"Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17090","snapshot_observed_at":"2026-08-07T12:45:49.200194Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:49.200194Z"},"links":{"cited_paper":"/paper/2312.17090","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:8dfc3b81e4f9b7617f86efadf3a9250967883a13e70216126a4286ca6e852838","observation_id":"c1df389f-4589-48c7-a8a1-380212b6e94c","resolution":{"observed_at":"2026-08-07T12:45:49.200194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.emnlp-main.719","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:50.747944Z","title":null,"venue":null,"work_id":"a4698ff2-fe61-44e3-bbe2-061bd894535e","year":2023},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:49.270104Z"},"links":{"citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:2e67d8745d0482d715c327919be290932d8ae11dd1601bf059b896093a9f01ae","observation_id":"f57660b8-ef58-4f99-8b06-e5b49585ffe6","resolution":{"observed_at":"2026-08-07T12:45:50.863614Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-07T12:45:49.396161Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:49.396161Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:3b580ac15e7802673c4bd57b17f93aa0763215ddfe3224716409fbc1e28214f7","observation_id":"1b6c111f-edbb-44fb-a5df-e83d32f5b28f","resolution":{"observed_at":"2026-08-07T12:45:49.396161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10484","last_updated":"2024-09-27T02:47:55Z","snapshot_observed_at":"2026-07-06T18:31:21.929350Z","submitted_at":"2024-06-15T03:28:52Z","title":"Beyond Raw Videos: Understanding Edited Videos with Large Multimodal Model","version":2},"cited_work":{"arxiv_id":"2406.10484","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.10484","snapshot_observed_at":"2026-08-07T12:45:51.031125Z","title":"Beyond Raw Videos: Understanding Edited Videos with Large Multimodal Model","venue":"cs.CV","work_id":"b77e91e4-c145-4da3-9131-e03783722e53","year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:49.527744Z"},"links":{"cited_paper":"/paper/2406.10484","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:302b5eb259febc85ef2b9c5e34e837603082acfb59b8caa6d5f3fa28600a8c41","observation_id":"e71d5117-a2c8-4d50-8e69-71e178bc275b","resolution":{"observed_at":"2026-08-07T12:45:51.193106Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-07T12:45:49.660056Z","title":"Gupta, Rilyn Han, Li Fei-Fei, and Saining Xie","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:49.660056Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:48caeabc609f33160cd027017098e5ec690edddce085b9c1ffd4f3e16b2af812","observation_id":"8b5b7977-9ef9-40da-b4e2-b95023332ad6","resolution":{"observed_at":"2026-08-07T12:45:49.660056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-07T12:45:49.782603Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:49.782603Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:fe87a0e141ad15d72c85442a495873a70972588baee6695952ce092884009060","observation_id":"3f443b40-92ff-4dd4-ad46-dac628dbf559","resolution":{"observed_at":"2026-08-07T12:45:49.782603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:53.059166Z","title":null,"venue":null,"work_id":"922588bb-7389-411f-bfee-c2bbf700e811","year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:49.921766Z"},"links":{"citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:1647b5f2a053fa4290259b749ccf6ae3a2f704f229c802cd36d065f6a433604c","observation_id":"0a2db99e-b946-47d9-8fae-57c1c058f341","resolution":{"observed_at":"2026-08-07T12:45:53.191528Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:52.803915Z","title":null,"venue":null,"work_id":"9ed2f5af-2f70-43c3-beac-d51e836ea736","year":2025},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:50.050824Z"},"links":{"citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:dd720f757e7417c0a28ce2752a2f8f981373b376750b3362e98d449f7aee61cd","observation_id":"41b00560-3f8b-45e5-a9b5-fce0cc131fb6","resolution":{"observed_at":"2026-08-07T12:45:52.913128Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-08-07T12:45:50.222550Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:50.222550Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:66b23e041f8a31a513489616a470282b3285eddd16c9236edc69b6963ddb3479","observation_id":"59f62b73-7618-40f5-89b7-ea8e69ca370f","resolution":{"observed_at":"2026-08-07T12:45:50.222550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:45:52.606481Z","title":null,"venue":null,"work_id":"5a9972cd-e396-4765-af14-d94c2b18099c","year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:50.343930Z"},"links":{"citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:2c8992720c3bb4c01f586f1b918b3c52a253552194dfb4d9d8cb0ae31b05106a","observation_id":"d798a551-6738-4141-8842-eda6e81f2314","resolution":{"observed_at":"2026-08-07T12:45:52.674815Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-07T12:45:50.619699Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:50.619699Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:137d5ebc180f8951b1e190cca66594ed74efe1dc737a022c0d8383bdc2562575","observation_id":"64e81e8d-5414-4023-a441-3494ccd95145","resolution":{"observed_at":"2026-08-07T12:45:50.619699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T18:41:28.769570Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":56,"verified_exact":6,"verified_fuzzy":1},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 1 inbound Pith citation observation for arXiv:2505.23693."}