{"as_of":"2026-08-23T00:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d415853daf0faa8a015524440773ae645156ac3d59cb76570e0c0ce1b7670e77","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:48:07.215828Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:53:20.756229Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T13:46:04.546310Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23484","snapshot_observed_at":"2026-08-06T20:53:20.756229Z","title":"Vcapsbench: A large-scale fine-grained benchmark for video caption quality evaluation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01492","last_updated":"2025-07-02T08:51:45Z","snapshot_observed_at":"2026-08-16T00:40:44.231211Z","submitted_at":"2025-07-02T08:51:45Z","title":"AVC-DPO: Aligned Video Captioning via Direct Preference Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:53:20.756229Z"},"links":{"cited_paper":"/paper/2505.23484","citing_paper":"/paper/2507.01492"},"observation_digest":"sha256:e066806693c4fa53fff86d41f8ba8f3232c57cd483b7866f7c0aca6f5bf660aa","observation_id":"b44abbe4-452e-4abe-804d-ad4bb0f2d803","resolution":{"observed_at":"2026-08-06T20:53:20.756229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23484","snapshot_observed_at":"2026-08-06T20:04:13.314128Z","title":"Vcapsbench: A large-scale fine-grained benchmark for video caption quality evaluation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03916","last_updated":"2025-07-26T08:13:41Z","snapshot_observed_at":"2026-08-16T11:25:03.298876Z","submitted_at":"2025-07-05T06:16:31Z","title":"Animation Needs Attention: A Holistic Approach to Slides Animation Comprehension with Visual-Language Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:04:13.314128Z"},"links":{"cited_paper":"/paper/2505.23484","citing_paper":"/paper/2507.03916"},"observation_digest":"sha256:a81eca1f1cec509a9d397c2a35e3f94902af16e3ef57d63bac6c04aee03e4cbd","observation_id":"8f9c5f80-2681-4dc3-aed7-67647c00322f","resolution":{"observed_at":"2026-08-06T20:04:13.314128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"cited_work":{"arxiv_id":"2505.23484","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23484","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vcapsbench: A large-scale fine-grained benchmark for video caption quality evaluation","venue":null,"work_id":"54c3bc77-819b-4cb0-82b7-f7884f34c492","year":2025},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-11T01:00:18.605708Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2505.23484","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:6b5064a89be3d329f07c3e18d88669b907d68b768fe622c7c59673665f7a155f","observation_id":"567f4ded-f209-43b9-981a-2df0fcec0af6","resolution":{"observed_at":"2026-05-11T13:46:04.547812Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23484/citation-record","integrity":"/paper/2505.23484/integrity","json":"/paper/2505.23484/citation-record.json","paper":"/paper/2505.23484"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T12:48:02.520983Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:02.520983Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:ae7e22a6695ebcf3f8d5100aba3f2d6bcfaca97998f31bca7a0caa4d6c9b2217","observation_id":"03050e34-d999-4475-85d2-d04b690f7b8f","resolution":{"observed_at":"2026-08-07T12:48:02.520983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:02.586430Z","title":"St-llm: Large language models are effective temporal learners","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:02.586430Z"},"links":{"citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:fd7950a97bce34ca3bd90edd68e68e16bebdf648504a3ec416df019f241f03e2","observation_id":"b0b8f65d-e99f-4a01-bf41-326df0955172","resolution":{"observed_at":"2026-08-07T12:48:02.586430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-18T00:01:15.410179Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-07T12:48:02.656403Z","title":"Cogvlm2: Visual language models for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:02.656403Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:f8dc53058b58558112719fdfd81e95a619532e91d008f6eaee7e835fc870920f","observation_id":"91c67106-19dc-4238-9ca3-0e6c841ed35d","resolution":{"observed_at":"2026-08-07T12:48:02.656403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-08-16T13:17:05.325564Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-08-07T12:48:02.748763Z","title":"Oryx mllm: On- demand spatial-temporal understanding at arbitrary resolution.arXiv preprint arXiv:2409.12961, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:02.748763Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:7aa8d9ab07f6877edfa2341712f5eb2dd09238d03f1a9cd032704f65acdead3e","observation_id":"7356ba04-1818-41c7-a294-66f14449f1a2","resolution":{"observed_at":"2026-08-07T12:48:02.748763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:09.395012Z","title":"Video-language alignment pre-training via spatio-temporal graph transformer","venue":null,"work_id":"43fab187-3f34-4fb0-89fb-54d7acb25b84","year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:02.819957Z"},"links":{"citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:6b9729131dabe4fa20c9cb3d4c1842ac8dd4dfcc04a8cf091ef142c17cf6bc3a","observation_id":"10b817f3-d4e9-4cb8-8ab9-e3a578ea3b04","resolution":{"observed_at":"2026-08-07T12:48:09.474243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-16T13:11:31.171443Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T12:48:02.870434Z","title":"Aria: An open multimodal native mixture-of-experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:02.870434Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:0edebbaedeae11b879932821c57ce63a9d5d0bd18c68166969030e6368b227b4","observation_id":"7e7399e0-866e-4842-a160-4c0336e41f05","resolution":{"observed_at":"2026-08-07T12:48:02.870434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:02.947034Z","title":"Video generation models as world simulators, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:02.947034Z"},"links":{"citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:dfb6d6d1f2ef1a97bfd190c489d5c23cec4b33bac6f9227a39556aad1c4ac466","observation_id":"48c8e754-b3e5-4bfd-a3a7-ed787af19b41","resolution":{"observed_at":"2026-08-07T12:48:02.947034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-16T13:54:44.432320Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-07T12:48:03.021385Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:03.021385Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:9490be87fce3d918398b047d009049c8f6ed4989f66907d6e9fbe514aca590ac","observation_id":"108ea320-d8ba-4fa5-945f-d231ff320481","resolution":{"observed_at":"2026-08-07T12:48:03.021385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04277","last_updated":"2024-10-14T07:20:01Z","snapshot_observed_at":"2026-08-16T13:45:26.242777Z","submitted_at":"2024-06-06T17:25:33Z","title":"VideoTetris: Towards Compositional Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04277","snapshot_observed_at":"2026-08-07T12:48:03.123192Z","title":"Videotetris: Towards compositional text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:03.123192Z"},"links":{"cited_paper":"/paper/2406.04277","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:0d74ef88807091e1bb93956190bae37e31c3062dcddc343ae23edfb872dde7e0","observation_id":"d87c70b1-fb7d-4622-82db-1c8158a86890","resolution":{"observed_at":"2026-08-07T12:48:03.123192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T12:48:03.216736Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:03.216736Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:bbfd7e829335c7454ebb609a581ca4ab1f55a533ec549e81b1904740f4e180cd","observation_id":"4be41c9c-1b62-4753-a3fc-9a370c66d0f2","resolution":{"observed_at":"2026-08-07T12:48:03.216736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-19T14:11:01.412437Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T12:48:03.349403Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:03.349403Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:a616c6f08439daa9ca79bc60901a9a36cca21b6b0561dd217f477dd26c20eb3b","observation_id":"604cc1a4-c2bd-4554-9788-ffd5f7ee5bf6","resolution":{"observed_at":"2026-08-07T12:48:03.349403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-08-13T20:40:43.794560Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-07T12:48:03.443005Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:03.443005Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:61c3fe5aea6d1586d0c0f49dc21bed23bba5e5cfdffa61ddb19f56064d4416bd","observation_id":"1c089519-5989-46a6-8049-06dae29c2cec","resolution":{"observed_at":"2026-08-07T12:48:03.443005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T12:48:03.522560Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:03.522560Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:45ef45e18230859b30367c18229c6777a50e387980c95d782786a788447d9607","observation_id":"87dc9914-32eb-456c-8fe1-f132e003f63a","resolution":{"observed_at":"2026-08-07T12:48:03.522560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-22T00:56:08.009523Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T12:48:03.630365Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:03.630365Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:a555ba7d557269819296e499366555f45477faa32f0e0e4819a3e518bf572062","observation_id":"ca8f7df3-eee6-4c56-a935-4718d59fa739","resolution":{"observed_at":"2026-08-07T12:48:03.630365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:03.678714Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:03.678714Z"},"links":{"citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:d1fff245aa0f268327a13edd4b0b2d6ce5760afc3737fb70af30ccb0b4130fa5","observation_id":"18be2f0e-2dec-4930-8261-00781e08b1b3","resolution":{"observed_at":"2026-08-07T12:48:03.678714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11303","last_updated":"2024-06-17T08:09:00Z","snapshot_observed_at":"2026-08-20T13:41:40.828943Z","submitted_at":"2024-06-17T08:09:00Z","title":"VideoVista: A Versatile Benchmark for Video Understanding and Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11303","snapshot_observed_at":"2026-08-07T12:48:03.738031Z","title":"Videovista: A versatile benchmark for video understanding and reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:03.738031Z"},"links":{"cited_paper":"/paper/2406.11303","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:7b4d3e8e7cfaeca5ada9618df563ecbdea936522adf6194fccc7faaacfafc030","observation_id":"7514bf63-6fd6-4d1f-91bb-5fac0532564c","resolution":{"observed_at":"2026-08-07T12:48:03.738031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08035","snapshot_observed_at":"2026-08-07T12:48:03.883798Z","title":"Lvbench: An extreme long video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:03.883798Z"},"links":{"cited_paper":"/paper/2406.08035","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:3f410a461c697002d62fdab351fc0ae4ed835c6688ee117a37ea7fe3b1cb9892","observation_id":"1ca62ed7-be29-483d-90e8-69510c4c986d","resolution":{"observed_at":"2026-08-07T12:48:03.883798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T12:48:04.018926Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:04.018926Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:14b14d44341b77aadba5128ed407b8dc197b2dc66478352c0409e8c5a22f8e18","observation_id":"e391e85d-caf0-4be4-ba9d-4bfa38b63f02","resolution":{"observed_at":"2026-08-07T12:48:04.018926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-07T12:48:04.125937Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:04.125937Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:5db2f0cf601ef148fe820c508c2f57194aed4c286d4bad4f7376f473bae86237","observation_id":"92774535-73c5-46e7-b9dd-0888bd1107d0","resolution":{"observed_at":"2026-08-07T12:48:04.125937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-15T01:28:11.776642Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-07T12:48:04.238595Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:04.238595Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:b1888fea317dca38da65c03cbd226e0be42e9fecffb77730061ec03c94a68962","observation_id":"91e2bce3-dc08-4307-8092-8bb49921bed9","resolution":{"observed_at":"2026-08-07T12:48:04.238595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:09.249463Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments","venue":null,"work_id":"4a42c85f-824e-47c1-ac8f-bd191f90e6cd","year":2005},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:04.401517Z"},"links":{"citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:ab029ac8c76fcb811b6846af53a94368448db0d61bb2fabcd2889939be0d3c68","observation_id":"1d0d03a3-e88d-47fd-89c1-0b0c68b212a7","resolution":{"observed_at":"2026-08-07T12:48:09.283671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:04.531335Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:04.531335Z"},"links":{"citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:4c843d58cfecfe05e3d7e1f2cd925ff721bdd269de09ec46b5896d8b72173889","observation_id":"27c90ae5-9b04-4307-97ac-d0e275bd7e07","resolution":{"observed_at":"2026-08-07T12:48:04.531335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:09.073611Z","title":"Spice: Semantic propositional image caption evaluation","venue":null,"work_id":"d67e19ea-c109-4ab4-a79f-cc3e39dd5903","year":2016},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:04.657753Z"},"links":{"citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:0750f0731bc29323abcf076d3b02f1797534c3e58376ede48e0bb52eac1e3c7c","observation_id":"aaf5d8e2-a9ab-4460-b1b3-ecdebf2b2111","resolution":{"observed_at":"2026-08-07T12:48:09.162468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:08.929654Z","title":"Cider: Consensus-based image description evaluation","venue":null,"work_id":"dca243f2-4a58-49ec-8f98-4edee638f0ef","year":2015},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:04.812105Z"},"links":{"citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:a1cf64064a43fd1379024791f2e420b4be731c3b662e74dab5f127e566e16e05","observation_id":"8eae858b-f127-4ec1-8692-fecdf326cbc3","resolution":{"observed_at":"2026-08-07T12:48:08.993453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06002","last_updated":"2023-05-10T09:22:44Z","snapshot_observed_at":"2026-08-18T11:06:41.337677Z","submitted_at":"2023-05-10T09:22:44Z","title":"InfoMetIC: An Informative Metric for Reference-free Image Caption Evaluation","version":1},"cited_work":{"arxiv_id":"2305.06002","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.06002","snapshot_observed_at":"2026-08-07T12:48:07.533234Z","title":"InfoMetIC: An Informative Metric for Reference-free Image Caption Evaluation","venue":"cs.CV","work_id":"c671e934-1259-4790-b218-15ad6804f809","year":2023},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:04.880205Z"},"links":{"cited_paper":"/paper/2305.06002","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:aab63909feef57545f0ca162958c4b43dad3368cce2a50e206e3fb8968ea62b6","observation_id":"e41919a3-e421-4640-9ab7-bfc5195ba06b","resolution":{"observed_at":"2026-08-07T12:48:07.629130Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-07T12:48:05.036979Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:05.036979Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:75e3eec6662c229799f2ca46c9d4215c108b08f1877e3021cf0ec7e657c46255","observation_id":"0f9a44b7-a0a1-4be7-b1ce-28d7858af71c","resolution":{"observed_at":"2026-08-07T12:48:05.036979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02050","last_updated":"2019-09-04T18:43:04Z","snapshot_observed_at":"2026-08-15T08:15:12.300483Z","submitted_at":"2019-09-04T18:43:04Z","title":"TIGEr: Text-to-Image Grounding for Image Caption Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.02050","snapshot_observed_at":"2026-08-07T12:48:05.100035Z","title":"Tiger: Text-to-image grounding for image caption evaluation","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:05.100035Z"},"links":{"cited_paper":"/paper/1909.02050","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:2d3592ca509dfa10ec4c4abc4911d747aaa314a3431c963f6eac910e376fabaa","observation_id":"51a60773-3653-4a53-b54e-5e1419e2f3bc","resolution":{"observed_at":"2026-08-07T12:48:05.100035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:08.769667Z","title":"Faier: Fidelity and adequacy ensured image caption evaluation","venue":null,"work_id":"5b6faa8c-7a6b-48fc-b893-5fed6c9887b3","year":2021},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:05.225598Z"},"links":{"citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:a86cc207a5dbd913a7c252abc02d91c6aeb41db09cef45e7629ec62039eb1ce1","observation_id":"e4e99203-a36b-4241-83d1-e51d4b59a629","resolution":{"observed_at":"2026-08-07T12:48:08.852277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.12560","last_updated":"2021-08-28T03:04:28Z","snapshot_observed_at":"2026-08-19T18:15:19.866964Z","submitted_at":"2021-08-28T03:04:28Z","title":"QACE: Asking Questions to Evaluate an Image Caption","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.12560","snapshot_observed_at":"2026-08-07T12:48:05.340321Z","title":"Qace: Asking questions to evaluate an image caption","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:05.340321Z"},"links":{"cited_paper":"/paper/2108.12560","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:9372fa154c46ebc971944be684ffa1648f0a1e874561ca7a4fa0edf4da2f4351","observation_id":"80f9082b-c0bc-438b-87d0-f70cf06cbf52","resolution":{"observed_at":"2026-08-07T12:48:05.340321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18235","last_updated":"2024-03-13T21:58:59Z","snapshot_observed_at":"2026-08-18T10:40:40.596551Z","submitted_at":"2023-10-27T16:20:10Z","title":"Davidsonian Scene Graph: Improving Reliability in Fine-grained Evaluation for Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18235","snapshot_observed_at":"2026-08-07T12:48:05.447336Z","title":"Davidsonian scene graph: Improving reliability in fine-grained evaluation for text-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:05.447336Z"},"links":{"cited_paper":"/paper/2310.18235","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:04e9c20e94bff63ed0f7d4256b8e9dd581025c8db8dd8710e309a375bcaa79ef","observation_id":"94835fee-ad4d-4552-bfd3-c7a69e491636","resolution":{"observed_at":"2026-08-07T12:48:05.447336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-12T17:58:56.652054Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-07T12:48:05.569130Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:05.569130Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:fa960c484b30348e28bfc1d47e8b57788f9780f011dc3b0bcad6fcf78840e820","observation_id":"ca0c2cc0-a29f-4877-8745-c2da3f8cebe0","resolution":{"observed_at":"2026-08-07T12:48:05.569130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10695","last_updated":"2024-10-21T20:01:13Z","snapshot_observed_at":"2026-08-21T06:07:33.885436Z","submitted_at":"2024-09-16T19:52:24Z","title":"Playground v3: Improving Text-to-Image Alignment with Deep-Fusion Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10695","snapshot_observed_at":"2026-08-07T12:48:05.725545Z","title":"Playground v3: Im- proving text-to-image alignment with deep-fusion large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:05.725545Z"},"links":{"cited_paper":"/paper/2409.10695","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:bd85cc67a9b2bcc40be558aa4f93f9b69337e88700397830653e5bad2a680760","observation_id":"715e4c1a-801f-4b0a-ba64-1693121f496e","resolution":{"observed_at":"2026-08-07T12:48:05.725545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:05.832538Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:05.832538Z"},"links":{"citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:12953a8096f7ac255b51b241ecd0472ff965ed1813b36c2006ff5a88609f2898","observation_id":"1e6aab97-6f55-4ebe-b869-2ad17a830399","resolution":{"observed_at":"2026-08-07T12:48:05.832538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:08.618501Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":"62e29686-2908-41d9-978c-f996d746cbe9","year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:05.912097Z"},"links":{"citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:a1feeb31b9a038d3cbc796060d4973501f4fe7bce80d2c8ebf47c780b60fd9b4","observation_id":"be0e6ff2-0a63-45fa-9211-af5ce307f4b5","resolution":{"observed_at":"2026-08-07T12:48:08.681194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:06.012064Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:06.012064Z"},"links":{"citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:27d9ff5d4926eca5ac6588d5827ae0fa8444824ff6a0a7e3774c9ebac9bf6d98","observation_id":"e981fc05-c3e7-4b6e-9485-436e038bc44c","resolution":{"observed_at":"2026-08-07T12:48:06.012064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:08.455081Z","title":"Bdd100k: A diverse driving dataset for heterogeneous mul- titask learning","venue":null,"work_id":"6e3350e2-2ff7-40a0-aad4-dc32b7998d20","year":2020},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:06.141445Z"},"links":{"citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:e673876162a8a98d7028ee5976fb648557a4038384d77ed3271f647d63fdc6fc","observation_id":"30cce918-10a6-4013-896b-4d5db85bf45d","resolution":{"observed_at":"2026-08-07T12:48:08.514759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:08.239522Z","title":"Sharegpt4video: Improving video understanding and gener- ation with better captions","venue":null,"work_id":"99af3d4e-d2b3-4639-b9bc-fa31a39d140b","year":null},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:06.246206Z"},"links":{"citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:5c1197182853e30b1b2ca9e97ca3885e5df6a5278b4167e788c1a2ea0d58a560","observation_id":"519aae23-4062-4797-a4bb-98b37ebac3b9","resolution":{"observed_at":"2026-08-07T12:48:08.330549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02629","last_updated":"2024-08-05T16:53:23Z","snapshot_observed_at":"2026-08-20T22:16:41.957100Z","submitted_at":"2024-08-05T16:53:23Z","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02629","snapshot_observed_at":"2026-08-07T12:48:06.335779Z","title":"Vidgen-1m: A large-scale dataset for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:06.335779Z"},"links":{"cited_paper":"/paper/2408.02629","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:2b21988310337bd51de1e7f0686f8ff4371b71f6a51183702e6096456a9ed5fc","observation_id":"01bdbe61-9ce9-47c0-a549-2bbcf545fcdb","resolution":{"observed_at":"2026-08-07T12:48:06.335779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18522","last_updated":"2024-10-01T20:00:27Z","snapshot_observed_at":"2026-08-16T13:39:20.718766Z","submitted_at":"2024-06-26T17:50:47Z","title":"ChronoMagic-Bench: A Benchmark for Metamorphic Evaluation of Text-to-Time-lapse Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18522","snapshot_observed_at":"2026-08-07T12:48:06.426328Z","title":"Chronomagic-bench: A benchmark for metamorphic evaluation of text-to-time-lapse video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:06.426328Z"},"links":{"cited_paper":"/paper/2406.18522","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:78f3c2bc11d66d30dac7ac0ca7a1acaf67cc9de3a4bb33a2ff1d28632b59e00d","observation_id":"c83f4534-ca87-450a-b9dd-c589c8e2b750","resolution":{"observed_at":"2026-08-07T12:48:06.426328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:08.094376Z","title":"Finevideo","venue":null,"work_id":"e77dbfb4-ef35-4e89-bd91-e094bb8d36aa","year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:06.573272Z"},"links":{"citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:da433d5d5ce9d5e3d80852e49d8f4efaee9035c4e83d38b0ce10ea3828825a46","observation_id":"95346c4f-8a5d-4ab4-8130-d501d820c0f4","resolution":{"observed_at":"2026-08-07T12:48:08.165287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04814","last_updated":"2025-03-05T02:43:42Z","snapshot_observed_at":"2026-08-19T22:35:54.363867Z","submitted_at":"2024-12-06T07:16:14Z","title":"LiFT: Leveraging Human Feedback for Text-to-Video Model Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04814","snapshot_observed_at":"2026-08-07T12:48:06.660518Z","title":"Lift: Leveraging human feedback for text-to-video model alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:06.660518Z"},"links":{"cited_paper":"/paper/2412.04814","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:21f198f3eba9d952738619df982e178821e843bffd130e9f5287a1c5ab1dc684","observation_id":"51bb15f3-bdcb-4d6f-8df0-9038d79f7a30","resolution":{"observed_at":"2026-08-07T12:48:06.660518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-21T16:02:41.546193Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T12:48:06.771636Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:06.771636Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:9f95bd544bcce3e0ad8be47620e263419a8be1eef5fe5671c9f2a65ddcd053e9","observation_id":"c4a451c7-54ff-418e-b871-b1b8cb46351d","resolution":{"observed_at":"2026-08-07T12:48:06.771636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:06.879949Z","title":"Video instruction tuning with synthetic data, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:06.879949Z"},"links":{"citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:33e810d8ecb7d01f362585210d7852bf2c0b0b4fbf39e3642450779c835385b5","observation_id":"25fef6ac-c440-4e1f-a169-4b430eaf73a4","resolution":{"observed_at":"2026-08-07T12:48:06.879949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-07T12:48:07.044736Z","title":"Nvila: Efficient frontier visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:07.044736Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:2eb83d73ace5d01fd873972a2dc1ed83d1fa89a956b094a38e9cfba8342f5bde","observation_id":"b8f94370-a633-46b5-aad4-a98a9265096e","resolution":{"observed_at":"2026-08-07T12:48:07.044736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-08-13T11:53:19.464291Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-07T12:48:07.215828Z","title":"↑\" indicates that the larger the value, the better; The symbol “↓","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:07.215828Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2505.23484"},"observation_digest":"sha256:fd98f08b35227e30f395bf910cd8c69cea854f11e16bae76fa87221069c28cbe","observation_id":"c90acecf-d0fb-429c-9fcf-a05ef4a08058","resolution":{"observed_at":"2026-08-07T12:48:07.215828Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23484","last_updated":"2025-05-29T14:34:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T02:04:57.644552Z","submitted_at":"2025-05-29T14:34:25Z","title":"VCapsBench: A Large-scale Fine-grained Benchmark for Video Caption Quality Evaluation"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":1,"verified_fuzzy":9},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 3 inbound Pith citation observations for arXiv:2505.23484."}