{"as_of":"2026-08-23T16:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8f336b61a641b5a2d3021d2ead886f221189d02c29dc98e6e51205ff2509f1ef","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:40:44.329318Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.04715/citation-record","integrity":"/paper/2506.04715/integrity","json":"/paper/2506.04715/citation-record.json","paper":"/paper/2506.04715"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T10:40:44.114739Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.114739Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:5085790d44ae8a1ce5f0faa3ee3d9606f533cbd56bcd9ba50ab9dc2b80054a57","observation_id":"a07b24ca-6e2a-4635-858e-02e5d81925f1","resolution":{"observed_at":"2026-08-07T10:40:44.114739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-07T10:40:44.119678Z","title":"Paligemma: A versatile 3b vlm for trans- fer.arXiv preprint arXiv:2407.07726, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.119678Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:3fd04354fd571cb9ec6701c1385a6d7c2a6b2e6742e4d25e57fa4534db01b776","observation_id":"d4d8a437-10dc-4032-a342-f2c0d627b82a","resolution":{"observed_at":"2026-08-07T10:40:44.119678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.961893Z","title":"Video generation models as world simulators.OpenAI Blog, 1:8, 2024","venue":null,"work_id":"59a301f5-a461-470d-9438-57eee6fb01ca","year":2024},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.124898Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:cdf23bb8910d9cce519a079c2b7a642e7cbb1955f8f69b92a2446283387f4e5d","observation_id":"a9ff83c0-0d01-4117-a313-954579a3319b","resolution":{"observed_at":"2026-08-07T10:40:44.965886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.951240Z","title":"Gaia: Rethinking action quality assessment for ai-generated videos.Advances in Neural Information Processing Systems, 37:40111–40144, 2024","venue":null,"work_id":"f18a2e5c-c244-4ca4-9e12-c5b4bcabcace","year":2024},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.129180Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:df5139fce96e21a97bd3627e2e291a57d421123f83148b5321104be8638eadc7","observation_id":"83054b39-1872-43d2-8751-5e7388374fbd","resolution":{"observed_at":"2026-08-07T10:40:44.955665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19238","last_updated":"2025-04-26T14:25:31Z","snapshot_observed_at":"2026-08-19T20:02:22.248191Z","submitted_at":"2024-12-26T14:44:47Z","title":"FineVQ: Fine-Grained User Generated Content Video Quality Assessment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19238","snapshot_observed_at":"2026-08-07T10:40:44.132814Z","title":"Finevq: Fine-grained user generated content video quality assessment.arXiv preprint arXiv:2412.19238,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.132814Z"},"links":{"cited_paper":"/paper/2412.19238","citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:94f41050921a4870dc18cb6594abc924e4023ad33bef0f3bb10d706baf01898b","observation_id":"cde9eb70-cf40-4b76-a9b0-568517b381e5","resolution":{"observed_at":"2026-08-07T10:40:44.132814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.940635Z","title":"Slowfast networks for video recognition","venue":null,"work_id":"2639c186-d683-4ceb-8318-b93c2c2b06fb","year":2019},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.136726Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:4496ae93031659b3575e57c944a3079c798bd6acd9457a8c41d7f8ab9745d2af","observation_id":"70292eb2-ec04-43d3-98fd-bddd339d4244","resolution":{"observed_at":"2026-08-07T10:40:44.944062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14008","last_updated":"2024-08-26T04:29:52Z","snapshot_observed_at":"2026-08-16T13:23:56.053262Z","submitted_at":"2024-08-26T04:29:52Z","title":"LMM-VQA: Advancing Video Quality Assessment with Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14008","snapshot_observed_at":"2026-08-07T10:40:44.140384Z","title":"Lmm-vqa: Advancing video quality assessment with large multimodal models.arXiv preprint arXiv:2408.14008,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.140384Z"},"links":{"cited_paper":"/paper/2408.14008","citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:a1fa31ec7a4fac58fda7365bf959e1f484ccaf352a4c7dc363433c2a66e4da0b","observation_id":"f107fd90-7332-4310-944a-47692c976595","resolution":{"observed_at":"2026-08-07T10:40:44.140384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T10:40:44.144122Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.144122Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:b31944123eb251ee85d5d099940ed2478210dc70a371818c045228f500a893bf","observation_id":"f27c5f0d-be89-4559-9385-25e53a47fc21","resolution":{"observed_at":"2026-08-07T10:40:44.144122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T10:40:44.148464Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.148464Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:7bc449014e23721528cfd96e1fc4ade043ee89db22beabeefd443415538faa8c","observation_id":"fe7a4433-8d72-4cca-8287-d3516d4b07e8","resolution":{"observed_at":"2026-08-07T10:40:44.148464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.153003Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.153003Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:f8fc7b36cfadc778c43795d037cf34f2fdb965b7048de13c4c84d32dc83dedfe","observation_id":"f15939d0-1231-49d1-9fdd-eb51e5b1d537","resolution":{"observed_at":"2026-08-07T10:40:44.153003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15252","last_updated":"2024-10-14T04:08:53Z","snapshot_observed_at":"2026-08-20T15:41:09.262032Z","submitted_at":"2024-06-21T15:43:46Z","title":"VideoScore: Building Automatic Metrics to Simulate Fine-grained Human Feedback for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15252","snapshot_observed_at":"2026-08-07T10:40:44.156703Z","title":"Videoscore: Building automatic metrics to simulate fine-grained human feedback for video genera- tion.arXiv preprint arXiv:2406.15252, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.156703Z"},"links":{"cited_paper":"/paper/2406.15252","citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:1e0062b083b5b4ec1e2fd5d49d9e22449b0188b0612a0939400862cc553c0242","observation_id":"29cdfd3c-1b3f-48eb-a91c-d9b440d1da04","resolution":{"observed_at":"2026-08-07T10:40:44.156703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-07T10:40:44.160413Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers.arXiv preprint arXiv:2205.15868, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.160413Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:7bf549f2ac3de9d5a6bf0fc63967ea120f558495933d381608a36cf1defbf79d","observation_id":"51e2a8d0-1b30-411c-8bc5-695271c9e2cc","resolution":{"observed_at":"2026-08-07T10:40:44.160413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.923316Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022","venue":null,"work_id":"dfdaf154-abe5-44ac-9bd0-356aa165d2b9","year":2022},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.164913Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:4f5c7711123f98cf418a3a4f73cf3c00b2659b43e3ac2983ed44cbef365ac7ca","observation_id":"0acd423a-8bc7-45bd-82bb-d9ac9d4f0e62","resolution":{"observed_at":"2026-08-07T10:40:44.926878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13503","last_updated":"2024-11-20T17:54:41Z","snapshot_observed_at":"2026-08-12T19:44:40.357419Z","submitted_at":"2024-11-20T17:54:41Z","title":"VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13503","snapshot_observed_at":"2026-08-07T10:40:44.168646Z","title":"Vbench++: Comprehensive and ver- satile benchmark suite for video generative models.arXiv preprint arXiv:2411.13503, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.168646Z"},"links":{"cited_paper":"/paper/2411.13503","citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:26da7461dc861fde0a1827bb5ea2c83b639e20c258e03bc5215784bbcec8e16a","observation_id":"b8ec7eb7-bf5b-4406-ba70-9c726a0943e9","resolution":{"observed_at":"2026-08-07T10:40:44.168646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.912913Z","title":"T2vbench: Benchmarking temporal dynamics for text-to- video generation","venue":null,"work_id":"95c0eab3-24f2-43e9-ac92-532da7616c69","year":2024},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.172419Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:ad8c55a03a5ce1f238bb68ba25b6898ba80ba69dafe498df8b3d88af322a4ab4","observation_id":"60577905-30eb-4f96-9fbe-9621bceebc64","resolution":{"observed_at":"2026-08-07T10:40:44.916843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03795","last_updated":"2024-12-02T12:09:39Z","snapshot_observed_at":"2026-08-19T18:23:27.906038Z","submitted_at":"2024-11-06T09:39:52Z","title":"VQA$^2$: Visual Question Answering for Video Quality Assessment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03795","snapshot_observed_at":"2026-08-07T10:40:44.175524Z","title":"Vqa 2: Visual question answering for video quality assessment.arXiv preprint arXiv:2411.03795,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.175524Z"},"links":{"cited_paper":"/paper/2411.03795","citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:ba2887d2d74dc1e8eff1974846187892a5c2797d361099686ca40e03cc03ea80","observation_id":"7a2f419a-51e4-492a-b327-16ce279e1381","resolution":{"observed_at":"2026-08-07T10:40:44.175524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-08-19T00:16:42.047230Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-08-07T10:40:44.179074Z","title":"Mantis: Interleaved multi-image instruction tuning.arXiv preprint arXiv:2405.01483, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.179074Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:98b0c3ce5a56d00a999a527042463fc6848a5f2717c1b11d3150c1605e948f21","observation_id":"07b76e28-bad1-4919-8c28-a32924d4c17f","resolution":{"observed_at":"2026-08-07T10:40:44.179074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-20T22:03:51.775198Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-07T10:40:44.182568Z","title":"The kinetics hu- man action video dataset.arXiv preprint arXiv:1705.06950,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.182568Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:c77ca31425af378ff7dc00c7deaae0f7a455a7f3f6a27b54a074d9920cf054e8","observation_id":"28be2090-27a2-493a-bb34-c42e933bb7af","resolution":{"observed_at":"2026-08-07T10:40:44.182568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T10:40:44.186888Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.186888Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:7f7df768cdcc7f373e6c3a6184cce72a5bbfbf770493944511657c8404104e1c","observation_id":"f2479dc1-eedd-4002-b112-57effcd4eaec","resolution":{"observed_at":"2026-08-07T10:40:44.186888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.902834Z","title":"Subjective-aligned dataset and metric for text-to-video qual- ity assessment","venue":null,"work_id":"db1a77ff-e0e1-4a9f-bd56-6d11d67c4fc5","year":2024},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.191010Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:19c16dbf3b5c4c6d5f3327f02dfddb9641062828eaa4d42e178b0bf34c86e3ee","observation_id":"3546953f-b69f-4dfe-ae73-3a59cb2b9460","resolution":{"observed_at":"2026-08-07T10:40:44.906519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.892673Z","title":null,"venue":null,"work_id":"b7838a70-5bc9-40b2-9e3e-893eed6aeab3","year":2022},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.194367Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:c20236c66e58b70aad18e355e75d5eb539e22ec7edb9e9322a6665087b4e2d1f","observation_id":"bf598dba-e315-46f0-9637-a073a898f36c","resolution":{"observed_at":"2026-08-07T10:40:44.896064Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.882920Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"51884cc6-532d-4761-97b4-5cec4abd4794","year":2022},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.197760Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:91463b9764163d7ca01d8f7019370449e5a95a15ef7b9d0f712380314c6d1f16","observation_id":"86903391-b6d1-4232-96c8-5b9b5d6993f0","resolution":{"observed_at":"2026-08-07T10:40:44.886501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.201863Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.201863Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:c4f0f655465eef054decec362d19d4e4a9e1400f18c761593019c5e7ad3048d2","observation_id":"d2a30562-a971-4681-bb31-80e0f58f61c2","resolution":{"observed_at":"2026-08-07T10:40:44.201863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.866961Z","title":"Unmasked teacher: Towards training-efficient video foundation models","venue":null,"work_id":"97fcbe27-e8bb-46af-8755-74e695d9d3af","year":2023},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.205993Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:9fe817ec53cfb484415e39a739bc24dcb62b436ab0bf00cda94ea283fdaa048d","observation_id":"0a2c6da0-da65-4cc0-a606-15fdd29e4e80","resolution":{"observed_at":"2026-08-07T10:40:44.870663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.856567Z","title":"Evaluating text-to-visual generation with image-to-text gen- eration","venue":null,"work_id":"1294983c-5700-4b68-8f04-703af4377aa9","year":2024},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.209106Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:bff19fd2af185d96b454bc9a9a5aa805e21511023f17fa972acabb57acaed1a6","observation_id":"52c7be92-9738-4ca7-9001-f73a2614b322","resolution":{"observed_at":"2026-08-07T10:40:44.860199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.846305Z","title":"Evalcrafter: Benchmarking and eval- uating large video generation models","venue":null,"work_id":"f7ee72df-8d27-4780-9d2f-1a3cf257bcba","year":2024},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.212430Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:1f103c85debff64735bf0c9ae885bb6be2a5af7661a548297a80ea4a7293a7fb","observation_id":"50455e1e-506f-456d-af73-905e59297120","resolution":{"observed_at":"2026-08-07T10:40:44.849788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.836369Z","title":"Fetv: A bench- mark for fine-grained evaluation of open-domain text-to- video generation.Advances in Neural Information Process- ing Systems, 36, 2024","venue":null,"work_id":"b2e9717e-0507-4942-a78d-0b9c2d4e1d1b","year":2024},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.215724Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:9bbb8065c8ff90b712aef6bf9b76d38fb485f7a8df6589afd361e417ecaff221","observation_id":"a43245b0-3b1d-4c7b-bba0-18ceef46d07d","resolution":{"observed_at":"2026-08-07T10:40:44.840009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.219006Z","title":"A convnet for the 2020s","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.219006Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:099e03d5af639255588bc2b2ef40307a313a132fc991e21b9debded908f058ea","observation_id":"6d2ec5a0-aad9-4d02-927a-461ea1eabbd5","resolution":{"observed_at":"2026-08-07T10:40:44.219006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.222932Z","title":"Video swin transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.222932Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:96e7191fb6ff63104c3355b06b43447eaca07fb5a2c2a0e69db15d923a4b8094","observation_id":"68e3b078-b8b3-463e-8df2-e46017142904","resolution":{"observed_at":"2026-08-07T10:40:44.222932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.226111Z","title":"Aigc- vqa: A holistic perception metric for aigc video quality assessment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.226111Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:9b6fb5537a95f4a4a092286c3c89fa1bb2615597d69da85614c0c001be07d83c","observation_id":"7fcb6ded-57e1-4926-93ef-bd9d10289684","resolution":{"observed_at":"2026-08-07T10:40:44.226111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-07T10:40:44.229202Z","title":"Step-video-t2v technical re- port: The practice, challenges, and future of video founda- tion model.arXiv preprint arXiv:2502.10248, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.229202Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:4578454ed88008dc0aedbf4eeeb663bf69120b5734871b5c7c320e5406bbf0d4","observation_id":"33b35cc4-aae1-44b0-a66c-a5948ce78f64","resolution":{"observed_at":"2026-08-07T10:40:44.229202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09642","last_updated":"2026-03-02T11:31:23Z","snapshot_observed_at":"2026-08-14T22:40:32.716624Z","submitted_at":"2025-03-12T05:00:07Z","title":"Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09642","snapshot_observed_at":"2026-08-07T10:40:44.233840Z","title":"Open-sora 2.0: Training a commercial-level video generation model in 200k.arXiv preprint arXiv:2503.09642, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.233840Z"},"links":{"cited_paper":"/paper/2503.09642","citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:5ace0be96706f56001e5f9c28f4a2a46f43f006192221d553567760e226c3a26","observation_id":"2bca5590-1785-4951-950f-004c454deaa0","resolution":{"observed_at":"2026-08-07T10:40:44.233840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T10:40:44.237208Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.237208Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:8824d88114ac40954571fef39d87f7fea3dc07347a66f73c0b9b32644c50169f","observation_id":"888614ba-6a5d-42af-a596-16d8e859fe87","resolution":{"observed_at":"2026-08-07T10:40:44.237208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.807482Z","title":"T2veval: Benchmark dataset and objective evaluation method for t2v-generated videos, 2025","venue":null,"work_id":"6c54e9d9-85b4-4260-a4f8-b58d761d04f2","year":2025},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.240669Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:8fd36595369e2d8d78cb22301717c454d0d7bd3a06da4e2a2f7687aaf1b62633","observation_id":"ac16df1a-4f5a-4c46-9528-58febc3545f8","resolution":{"observed_at":"2026-08-07T10:40:44.811727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.244030Z","title":"Comprehensive subjective and objective evaluation method for text-generated video.arXiv preprint arXiv:2501.08545, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.244030Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:51c95e5ee692172faee2ceaf97b40923a623b75c0e86efdab162886711f65715","observation_id":"de7c3ed7-5a84-453a-ac76-80d65a94535e","resolution":{"observed_at":"2026-08-07T10:40:44.244030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.247250Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.247250Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:d879af5685ff031e6aac5b8551c57d049697a1979ae39272d9370edd529c4d31","observation_id":"63dfae0d-6ccf-4033-98da-c0ba011c92b3","resolution":{"observed_at":"2026-08-07T10:40:44.247250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-07T10:40:44.250446Z","title":"Make-a-video: Text-to-video generation without text-video data.arXiv preprint arXiv:2209.14792,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.250446Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:14e5612c2fa2d8de9a5e0a6d329c7381a46e43b1b06ef695b3c3f8a1233544e1","observation_id":"c5f906f3-4809-4d6c-bff4-c63f59be90d3","resolution":{"observed_at":"2026-08-07T10:40:44.250446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.791048Z","title":"A deep learning based no-reference quality assessment model for ugc videos","venue":null,"work_id":"76911ff7-b193-4249-8f1b-099c1e03ee62","year":2022},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.254002Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:c39bb1612dc5cd2dae405c4412924c85bbd6fec99ca70d10d92d50287146f99d","observation_id":"48e0d44d-f7df-49e8-840a-43702c398847","resolution":{"observed_at":"2026-08-07T10:40:44.794543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T10:40:44.257047Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of con- text.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.257047Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:d3d991791399c1e9ff5fb97326df8797156a4507d45abf7abee405f429c733dd","observation_id":"66e8f99e-4d92-4084-908c-0a625085a732","resolution":{"observed_at":"2026-08-07T10:40:44.257047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17221","last_updated":"2024-11-26T08:43:15Z","snapshot_observed_at":"2026-08-20T07:29:12.827653Z","submitted_at":"2024-11-26T08:43:15Z","title":"AIGV-Assessor: Benchmarking and Evaluating the Perceptual Quality of Text-to-Video Generation with LMM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17221","snapshot_observed_at":"2026-08-07T10:40:44.261429Z","title":"Aigv-assessor: Benchmarking and eval- uating the perceptual quality of text-to-video generation with lmm.arXiv preprint arXiv:2411.17221, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.261429Z"},"links":{"cited_paper":"/paper/2411.17221","citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:d99bb207ada0e3a9c8abb4b804f9d46d6021d543a5b5c81f0ab2fed0d5e87ea2","observation_id":"3401f142-855d-4df7-b9ee-8fa22fea7c2f","resolution":{"observed_at":"2026-08-07T10:40:44.261429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.265763Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.265763Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:581bef2bcee28fbad4f2063279471fabfd323c70ef71ba3268f6258ed3b351c3","observation_id":"1add9b73-f19b-4630-bd41-a83353015b22","resolution":{"observed_at":"2026-08-07T10:40:44.265763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-07T10:40:44.268995Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation.arXiv preprint arXiv:2307.06942, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.268995Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:84b2c4c28f029f88482ae08aa9809d6576371eb09cd828e0487ea1a784c1ad39","observation_id":"e871c747-e2c3-4241-9229-d221f6bd513f","resolution":{"observed_at":"2026-08-07T10:40:44.268995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.774565Z","title":"An ensemble approach to short-form video quality assess- ment using multimodal llm","venue":null,"work_id":"90c0cea4-2207-4477-921d-9103101e9cdd","year":2025},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.272673Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:da3312d969569c874236b77c8d593c71f007933d07045a8453ff99acaf616133","observation_id":"aa25a1f6-2f0c-4953-900c-79ed1d994ee9","resolution":{"observed_at":"2026-08-07T10:40:44.778286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14806","last_updated":"2021-04-30T07:40:35Z","snapshot_observed_at":"2026-08-16T18:27:58.328538Z","submitted_at":"2021-04-30T07:40:35Z","title":"GODIVA: Generating Open-DomaIn Videos from nAtural Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.14806","snapshot_observed_at":"2026-08-07T10:40:44.276578Z","title":"Godiva: Gen- erating open-domain videos from natural descriptions.arXiv preprint arXiv:2104.14806, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.276578Z"},"links":{"cited_paper":"/paper/2104.14806","citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:f07f612e95015380fb43ed5cca2ba9db6f6d4b8f27f13f5e2543e4ffec275fac","observation_id":"e23de760-b9c2-480a-878d-6b13cfd6ef92","resolution":{"observed_at":"2026-08-07T10:40:44.276578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.764188Z","title":"Fast- vqa: Efficient end-to-end video quality assessment with frag- ment sampling","venue":null,"work_id":"b718ad65-9e1d-45e0-bbe8-2f43f6ed5e2b","year":2022},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.280372Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:fb2e282a69caf6ceb02bdc46485967073ee0f3681a9d05f6c85b87b56c2ca50c","observation_id":"cb7d9e39-8d5e-4bc2-b803-cd00513ada45","resolution":{"observed_at":"2026-08-07T10:40:44.767817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.753529Z","title":"Exploring video quality assessment on user gener- ated contents from aesthetic and technical perspectives","venue":null,"work_id":"fdbb951d-386b-4c7b-a0ac-942848843e5f","year":2023},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.283644Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:f8a5a24678f5b54f17cde1f78dfe7d5c058fa1e8b18e9ec2b3834ee83c63cfce","observation_id":"dfa46c75-9ae7-41ab-9d46-a60028823639","resolution":{"observed_at":"2026-08-07T10:40:44.757489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17090","last_updated":"2023-12-28T16:10:25Z","snapshot_observed_at":"2026-08-02T07:14:02.308302Z","submitted_at":"2023-12-28T16:10:25Z","title":"Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17090","snapshot_observed_at":"2026-08-07T10:40:44.287561Z","title":"Q-align: Teaching lmms for visual scoring via discrete text-defined levels.arXiv preprint arXiv:2312.17090, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.287561Z"},"links":{"cited_paper":"/paper/2312.17090","citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:6d68b05501a541d8a5d221a36465e20933f6e11cbd9096049a553c439253c96c","observation_id":"b5b8cca9-1ef2-4526-bf60-e1b449fd3dea","resolution":{"observed_at":"2026-08-07T10:40:44.287561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.291522Z","title":"Q-instruct: Improving low-level visual abilities for multi-modality foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.291522Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:388e0846aa41946848941b9b88ceb2bfe8e4f1f29b1531fcaa0b0839ef51f8d5","observation_id":"ef889838-8e80-4eb4-b263-6611978d116c","resolution":{"observed_at":"2026-08-07T10:40:44.291522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.734221Z","title":"Grit: A gener- ative region-to-text transformer for object understanding","venue":null,"work_id":"e4537396-29b0-4583-9940-829aaa831760","year":2024},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.294798Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:470e78305a7eb89db1691965a987a5e4609fe163aec348d89ac4016c595b53da","observation_id":"97ca7cfb-dd89-4015-892b-afcd42b9f595","resolution":{"observed_at":"2026-08-07T10:40:44.739499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.722382Z","title":"Ntire 2025 xgc quality assessment challenge: Methods and results.CVPR Workshop, 2025","venue":null,"work_id":"612be159-f9a2-4b16-85c1-a957ba28c6d7","year":2025},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.298447Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:3c2af9c2b53adf96980ef2287220bbc119871f831b956771a576e93c89caf9e3","observation_id":"7a8f4aa1-f205-479f-a0f0-c7e1f99203cd","resolution":{"observed_at":"2026-08-07T10:40:44.726400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.301982Z","title":"Imagere- ward: Learning and evaluating human preferences for text- to-image generation.Advances in Neural Information Pro- cessing Systems, 36:15903–15935, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.301982Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:1decca684e74cdf1c466dbe6415ea8408d8a3ef90db0d2bf3fffd122d7f01ab8","observation_id":"f0a91cb3-f3a7-4f3b-b077-ae9e4c66857c","resolution":{"observed_at":"2026-08-07T10:40:44.301982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.704101Z","title":"Imagere- ward: Learning and evaluating human preferences for text- to-image generation.Advances in Neural Information Pro- cessing Systems, 36, 2024","venue":null,"work_id":"d649c964-da89-49c5-b3dd-e16fabcc20f2","year":2024},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.305309Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:669a5ec49adbef5f7367bc1046998586f19c693330c3e29814524ac7eb86490e","observation_id":"b4ac5347-e102-48d8-8855-c34593cfa4f2","resolution":{"observed_at":"2026-08-07T10:40:44.708029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T10:40:44.309647Z","title":"Qwen2.5 technical report.arXiv preprint arXiv:2412.15115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.309647Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:23e521d74d8bc9a0dc62d850d1c2bda9610aa8ddb4c65578687b478cef86e0b7","observation_id":"1cb4c45e-3c98-40cd-809e-609daf22a195","resolution":{"observed_at":"2026-08-07T10:40:44.309647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.692937Z","title":"Chronomagic-bench: A bench- mark for metamorphic evaluation of text-to-time-lapse video generation.Advances in Neural Information Processing Sys- tems, 37:21236–21270, 2024","venue":null,"work_id":"d5ac14a8-2cc2-4979-a248-7223c9320795","year":2024},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.313355Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:9498caa2a137afed67a9a39d886d5d45051245c863ec09f3b53ea51a4d40c6de","observation_id":"b071af26-8d4c-4a8a-aa99-61b0b8eaa9f5","resolution":{"observed_at":"2026-08-07T10:40:44.696715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.316789Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.316789Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:27e700006899666e8b15d6ae37c82e74223b2bad10163ed9ad5fadd7d42ac130","observation_id":"9ffb76a0-0386-44f1-bab9-528dcac89c26","resolution":{"observed_at":"2026-08-07T10:40:44.316789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02357","last_updated":"2025-06-15T14:09:58Z","snapshot_observed_at":"2026-08-19T04:18:08.147741Z","submitted_at":"2025-03-04T07:28:45Z","title":"Q-Eval-100K: Evaluating Visual Quality and Alignment Level for Text-to-Vision Content","version":3},"cited_work":{"arxiv_id":"2503.02357","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.02357","snapshot_observed_at":"2026-08-07T10:40:44.359717Z","title":"Q-Eval-100K: Evaluating Visual Quality and Alignment Level for Text-to-Vision Content","venue":"cs.CV","work_id":"cb0756f7-86cb-46be-87a9-ca42e6b35b26","year":2025},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.320792Z"},"links":{"cited_paper":"/paper/2503.02357","citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:59ac90c544bb444d8e2d27e5feb995850489c60d992a0fc94519795b7a288612","observation_id":"86fbed20-9b37-4249-8fee-373b6ee76418","resolution":{"observed_at":"2026-08-07T10:40:44.365547Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.675125Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems, 36:46595–46623, 2023","venue":null,"work_id":"e7e0b174-f6c8-4f7b-ac55-657e1c848033","year":2023},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.324872Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:d30f8b29c213acaf0f52cb1bd3ac799dd6db14c1c0c70f21de492395d67e01c4","observation_id":"03188bb0-db5f-41f1-a1fd-eb982ab514e2","resolution":{"observed_at":"2026-08-07T10:40:44.679396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:44.664030Z","title":"Open-sora: Democratizing efficient video production for all, march 2024.URL https://github","venue":null,"work_id":"2349ad60-4249-41f9-9d10-b2649e0c66fb","year":2024},"citing_paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:44.329318Z"},"links":{"citing_paper":"/paper/2506.04715"},"observation_digest":"sha256:3bdf862e34d4e0addf6f449fe73cdc4a70db6d714d12703e44fc39d0826a9afb","observation_id":"f0b9a4e7-9957-4256-9693-8c4568e6499d","resolution":{"observed_at":"2026-08-07T10:40:44.668091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.04715","last_updated":"2025-06-12T03:43:41Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-21T22:06:54.710762Z","submitted_at":"2025-06-05T07:40:12Z","title":"Towards Holistic Visual Quality Assessment of AI-Generated Videos: A LLM-Based Multi-Dimensional Evaluation Model"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":1,"verified_fuzzy":22},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2506.04715."}