{"as_of":"2026-08-13T11:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1ca73cc7fbdf3a038ce648c26a3eb429bc7acd45cd1f94406b7b054f0da5c074","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T05:24:17.842065Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T19:10:07.699225Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T23:25:51.674329Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"cited_work":{"arxiv_id":"2412.17637","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.17637","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"06a13ecb-fcc6-4852-a1e9-5d1c7c1357cb","year":2024},"citing_paper":{"arxiv_id":"2604.04419","last_updated":"2026-04-06T04:56:49Z","snapshot_observed_at":"2026-08-11T05:12:20.700971Z","submitted_at":"2026-04-06T04:56:49Z","title":"BoxComm: Benchmarking Category-Aware Commentary Generation and Narration Rhythm in Boxing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T19:10:07.699225Z"},"links":{"cited_paper":"/paper/2412.17637","citing_paper":"/paper/2604.04419"},"observation_digest":"sha256:67aee3253341eb916b0685cbf951cf190939fc1b9957b5b3399900341f1064be","observation_id":"9412f7ea-5c9d-4aa8-b13c-2020277ff3bd","resolution":{"observed_at":"2026-05-10T23:25:51.682028Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"cited_work":{"arxiv_id":"2412.17637","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.17637","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"06a13ecb-fcc6-4852-a1e9-5d1c7c1357cb","year":2024},"citing_paper":{"arxiv_id":"2604.15736","last_updated":"2026-04-17T06:22:41Z","snapshot_observed_at":"2026-08-12T00:39:44.371309Z","submitted_at":"2026-04-17T06:22:41Z","title":"RefereeBench: Are Video MLLMs Ready to be Multi-Sport Referees","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T08:38:27.081358Z"},"links":{"cited_paper":"/paper/2412.17637","citing_paper":"/paper/2604.15736"},"observation_digest":"sha256:20a7accb7b333c58760a21ef43a9c1d9dc777550170ab20bc6769099d30ed600","observation_id":"5ba8e445-dd51-4bbc-964e-2b2d7c78c243","resolution":{"observed_at":"2026-05-10T08:48:02.282471Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.17637/citation-record","integrity":"/paper/2412.17637/integrity","json":"/paper/2412.17637/citation-record.json","paper":"/paper/2412.17637"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.683409Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.683409Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:f71821f45b0736a3df3adebc486630e32b03ad00cccd2b97d6581af5c57d61fb","observation_id":"8b6535f5-61bb-4049-acd1-2fe75a8907d3","resolution":{"observed_at":"2026-08-11T05:24:17.683409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.273551Z","title":"Spice: Semantic propositional image caption evaluation, 2016","venue":null,"work_id":"9b611260-e04a-4797-804d-e8346d17d7cc","year":2016},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.687975Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:ff45fa14b96f0e81003c342ba1fe4aaec03baf77d8d3b18331fe279908aac234","observation_id":"e55d5ec1-caed-4f9d-bfec-fc3518af17e9","resolution":{"observed_at":"2026-08-11T05:24:18.277345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.263550Z","title":"METEOR : An automatic metric for MT evaluation with improved correlation with human judgments","venue":null,"work_id":"3a943f09-e76c-419e-a009-f336d1e42b07","year":2005},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.691725Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:258e78674f4ce81c2406e688f5558fe62ec8d3ee27909635850caac21494d901","observation_id":"92643bb3-53a7-4370-82e1-8eb769cc1569","resolution":{"observed_at":"2026-08-11T05:24:18.267206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.253127Z","title":"P2anet: A dataset and benchmark for dense action detection from table tennis match broadcasting videos, 2024","venue":null,"work_id":"8f403521-3cf1-4827-b6b0-0dd7b70d674b","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.695503Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:4aeb000bc1abdf9a72bb22c9373402e424fef9e51be598bd8abc3491a1855f48","observation_id":"81aa4ebc-e894-4060-853e-1f87748c46ba","resolution":{"observed_at":"2026-08-11T05:24:18.257020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.699465Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.699465Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:89239a32b29615a6b4b65df7530f6e0bfe8f55f74b0c4fc2e1367f14b8864fee","observation_id":"d38a36f9-cdc7-4668-81bc-d2bff5b5d90e","resolution":{"observed_at":"2026-08-11T05:24:17.699465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.236387Z","title":"Autoeval-video: An automatic benchmark for assessing large vision language models in open-ended video question answering, 2024 a","venue":null,"work_id":"5cf3f5bf-9c8e-4cdd-8c1a-b797e883212c","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.703060Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:850e83a05e2eae8e103f845e3f63fe653a7f986a926ddcccfe94b4d6021c436a","observation_id":"01fb1590-e1ab-4220-ae56-24e768fe32bf","resolution":{"observed_at":"2026-08-11T05:24:18.240253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.225905Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks, 2024 b","venue":null,"work_id":"db976fcd-27fa-475f-8493-0e8d60c892dc","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.706887Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:fe255ddc6c4b45f7dbce0f893df506bc27b0bb4f626346e59ccfedc42e5bd1a8","observation_id":"4885a10a-2b21-4003-bcdf-004717ab064e","resolution":{"observed_at":"2026-08-11T05:24:18.229784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.214933Z","title":"Sports re-id: Improving re-identification of players in broadcast videos of team sports, 2022","venue":null,"work_id":"b1426dc7-db8b-42b3-ab66-db566ce78567","year":2022},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.710525Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:14bf309e6623195cd8e6914961793ebeecdca4b77f5ac833d7ef87b39ff34552","observation_id":"49590249-4420-459c-86fb-112a787c439a","resolution":{"observed_at":"2026-08-11T05:24:18.218808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.205374Z","title":"Seikavandi, Jacob V","venue":null,"work_id":"179f0bc0-0be2-48e0-957d-f0d4dc1b18d5","year":2021},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.713845Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:e1d24b7394dd7c4c2b9acb4af4be023306d91bcbe00e0f11f7fae7fd62661595","observation_id":"a09997db-526f-4884-9426-88cfca800994","resolution":{"observed_at":"2026-08-11T05:24:18.208594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.196065Z","title":"Mmbench-video: A long-form multi-shot benchmark for holistic video understanding, 2024","venue":null,"work_id":"b55a1c0a-e76e-4042-9ec5-35a10b287b09","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.717112Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:435e610bd04a95f1ed77de3e7a65baa6a13af5dfaec434a89ed8e64e2e1ce649","observation_id":"bd052060-cac3-4270-9fd0-2fc4fa6f6edc","resolution":{"observed_at":"2026-08-11T05:24:18.199517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.187151Z","title":null,"venue":null,"work_id":"00d96456-681d-4045-a3b8-c5ded8e45037","year":2017},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.720502Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:ea5de173314df4b96f265dca654e4c19ea7cc3fcf182a52598c2ad875a57082d","observation_id":"b6b813a9-e419-4a29-be55-548f911c8fe4","resolution":{"observed_at":"2026-08-11T05:24:18.190434Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.176581Z","title":"Chatpose: Chatting about 3d human pose","venue":null,"work_id":"567f9fb7-0c95-401f-8c17-e6b5c37f047a","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.723725Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:541f626942c3b57aac77084b9c737185c29d24a13bddb319ba6c6cb8743596a9","observation_id":"201e4a8c-2feb-4498-8750-0a5980363c45","resolution":{"observed_at":"2026-08-11T05:24:18.180323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.731047Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.731047Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:3bba017afd1624618355586b50cc8eba3421f1ec7b940cd08c36ee860770fdc1","observation_id":"ee94795f-eb39-4741-ba3c-83ad9bbe4e93","resolution":{"observed_at":"2026-08-11T05:24:17.731047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.159902Z","title":"Mini-internvl: A flexible-transfer pocket multimodal model with 5","venue":null,"work_id":"dedf2b4a-5e12-4565-b706-cd8ce15bf7c4","year":null},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.734832Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:f78397cf8f420ad18f0ddd5300be1c3c47525375f2c84d3e7207f31a2ac7ef23","observation_id":"f753cd98-bff0-460d-ac1f-22c9961d08f5","resolution":{"observed_at":"2026-08-11T05:24:18.163828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.149996Z","title":"Tgif-qa: Toward spatio-temporal reasoning in visual question answering, 2017","venue":null,"work_id":"9a2ccce9-0835-4f00-b2b2-d02a0abae1e1","year":2017},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.738244Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:709a731841445ab3eee84f8c04f1fc9d442505bf3a1b4b04ff7843d1aa327c14","observation_id":"5dab9f72-2add-4922-81fc-e92616989e7d","resolution":{"observed_at":"2026-08-11T05:24:18.153707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.139315Z","title":"Chat-univi: Unified visual representation empowers large language models with image and video understanding, 2024","venue":null,"work_id":"2c93fbeb-9952-45cb-baa8-2c8182da0a2b","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.741346Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:54ec65a610b046b1134c410c7c622c1b5edbe3a8f512cef2fa0b66385fef9601","observation_id":"f367ceff-082e-4348-8159-16ea306ededa","resolution":{"observed_at":"2026-08-11T05:24:18.143230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.744141Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.744141Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:9a2dabc52d83552c4a28f6eedf27768a7592beb39254dd0a2f5356ef71881481","observation_id":"7fa9b383-63be-4c0d-96d7-e83b3e6a0fb5","resolution":{"observed_at":"2026-08-11T05:24:17.744141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.123987Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark, 2024","venue":null,"work_id":"ad4d70a0-32de-4dc7-9fa9-eec29e62e0b6","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.746975Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:c15b36b68e2ea60e286f14b945d4486ae47cdb911070ffb46e5499dd9a76a0d9","observation_id":"d0c9d076-ab13-4cf7-ba77-886c8f7d102d","resolution":{"observed_at":"2026-08-11T05:24:18.127754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.749606Z","title":"Video-llava: Learning united visual representation by alignment before projection, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.749606Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:c2b07a5d4ce673cd5dc6ff118231c82f1fa4f73cf3e31994f39dc3b7e97d8a75","observation_id":"63c2705e-2a9b-4b8f-94ca-53e371c0145a","resolution":{"observed_at":"2026-08-11T05:24:17.749606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.752192Z","title":"ROUGE : A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.752192Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:902fbef8afa90f3e7cae2a0daf7fea50b071c80bbe29727675f5a9e8fd1a5dcb","observation_id":"a8cb6f5d-a8c1-4014-abe8-39cf5a8b1c5f","resolution":{"observed_at":"2026-08-11T05:24:17.752192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.101604Z","title":"Vila: On pre-training for visual language models, 2024","venue":null,"work_id":"d0b5a77c-406b-4afd-9816-cdff9a509e45","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.755116Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:e0ccec3e0515a8f715d5a6e4bf48a17e4bda11e53d537c66e5288fd0cadfa012","observation_id":"2dde1edb-3b92-4512-b7ae-b2c24263de32","resolution":{"observed_at":"2026-08-11T05:24:18.105842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.091012Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, 2024 a","venue":null,"work_id":"b82afa2a-7b5f-4470-a3eb-f173a1bcd6fe","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.757693Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:5bda7608dbcef6cedc3ca6043ee2718c9cddb8918dcd1dd355551d5bb1db9ddf","observation_id":"272a74c3-c035-45fa-b6d7-4b5bcc9a23e1","resolution":{"observed_at":"2026-08-11T05:24:18.094806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.079856Z","title":"Kangaroo: A powerful video-language model supporting long-context video input, 2024 b","venue":null,"work_id":"03bd12a4-9564-497f-965d-43e365eeaea4","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.760420Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:b3d5d3dc270a834b188590ae49012f769ffb94c699065b028f9e25bd694eb73d","observation_id":"5f312c6c-c424-4e8b-9f60-e60a9de35532","resolution":{"observed_at":"2026-08-11T05:24:18.083902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.069689Z","title":"Fineaction: A fine-grained video dataset for temporal action localization","venue":null,"work_id":"132582ca-0df4-4244-9584-8fdfc10e3ef7","year":2022},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.763437Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:5af526ec4843717f7e1b0f582ecc14ca4c5901f65b75f0c57801ecf8ab24b0bb","observation_id":"d441747c-01e2-428a-a79d-1b96fcec39e9","resolution":{"observed_at":"2026-08-11T05:24:18.073076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.059576Z","title":"Tempcompass: Do video llms really understand videos?, 2024 c","venue":null,"work_id":"7f19078e-4f26-41c5-88b4-a8fbcc2fcf5d","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.767152Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:962fa9677105b344a11cc3966146437d583b7124d014656b448bbbbf8d82a66f","observation_id":"a5b2fb07-83a1-4be2-8113-58add5c6f016","resolution":{"observed_at":"2026-08-11T05:24:18.063005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.049778Z","title":"Cross-block fine-grained semantic cascade for skeleton-based sports action recognition, 2024 d","venue":null,"work_id":"fae31cd3-7ce5-4549-a947-f5872943584b","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.770554Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:14023478c3bc0f2add6b4f813d21b06687a3930c876c4926cf99210d260ec550","observation_id":"495a771b-3799-45de-8bc8-c6f62180a8e1","resolution":{"observed_at":"2026-08-11T05:24:18.053087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.773955Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.773955Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:4d9bad91b919821e36611e424f7ec98389d397137cea0691b9ca090ee0727789","observation_id":"1bf485d7-49e8-4bf9-87c5-ea611345cbe1","resolution":{"observed_at":"2026-08-11T05:24:17.773955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.777547Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.777547Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:9a3d7d8003cba3ed8c7af9a0cfa4d78c97ea82e46566e9e5ca93ce22e9ca9be7","observation_id":"914eb97b-14ed-45ae-b0f7-c9c1f81aa64d","resolution":{"observed_at":"2026-08-11T05:24:17.777547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16103","last_updated":"2023-11-28T18:16:29Z","snapshot_observed_at":"2026-08-13T05:16:05.220753Z","submitted_at":"2023-11-27T18:59:58Z","title":"Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16103","snapshot_observed_at":"2026-08-11T05:24:17.780895Z","title":"Video-bench: A comprehensive benchmark and toolkit for evaluating video-based large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.780895Z"},"links":{"cited_paper":"/paper/2311.16103","citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:978052ba39d0701a887206d08536c50d0a4c0396360e0a9b5de67f30dc9e4bf9","observation_id":"790bf743-95bc-4de3-be39-e8ff36a81b80","resolution":{"observed_at":"2026-08-11T05:24:17.780895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.027714Z","title":"Video-bench: A comprehensive benchmark and toolkit for evaluating video-based large language models, 2023 b","venue":null,"work_id":"5fde3ee0-2897-452d-ab28-4d1d8c88d987","year":2023},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.784738Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:9a9fc3925b7a507992d15d70af39d6d147a339aaf9515f2cffd21b532a045835","observation_id":"00e92d4e-b813-4d32-9c87-1de79dd35e53","resolution":{"observed_at":"2026-08-11T05:24:18.031890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.016249Z","title":"B leu: a method for automatic evaluation of machine translation","venue":null,"work_id":"2060bd04-14ac-4fbe-bf26-f67b75c87d46","year":2002},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.787974Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:0ecb144c9db374dccb12098b5aeb2c7d31918e377d461d67580c24720b54ae07","observation_id":"318f1244-9d23-4391-96f8-c4276da2d98e","resolution":{"observed_at":"2026-08-11T05:24:18.020253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:18.004945Z","title":"Perception test: A diagnostic benchmark for multimodal video models, 2023","venue":null,"work_id":"05c2eb0b-350e-4d7c-a12f-c2d71df73ef0","year":2023},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.791466Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:54809b895f3257660195934c4aa1cbc0262f43f404ea3545ebfe2b6d387af6a5","observation_id":"1e62d750-37c1-48f2-a52e-ff97f2b59ddd","resolution":{"observed_at":"2026-08-11T05:24:18.009190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.991313Z","title":"A survey of video datasets for grounded event understanding","venue":null,"work_id":"252ecd16-76d0-4f02-85d1-d512086cdaa7","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.794736Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:f1d5bceb8d475bbb60aa27d629a9c5bddf3da0b780af7f9b2ca104a6bfab8d4e","observation_id":"7ec357c2-f255-4e71-b76b-c16c38beb508","resolution":{"observed_at":"2026-08-11T05:24:17.996400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.797956Z","title":"Finegym: A hierarchical video dataset for fine-grained action understanding, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.797956Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:55a16e7e27ac8500b56ff7e61e7c9f8b3997d8e97058cdde3937c34c7bfd42a1","observation_id":"194d3318-23d9-447d-b2c2-4ee768d1fea6","resolution":{"observed_at":"2026-08-11T05:24:17.797956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.801306Z","title":"Visual cot: Advancing multi-modal language models with a comprehensive dataset and benchmark for chain-of-thought reasoning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.801306Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:8744ada247554cadfc96ea4e17b8e31b046c30c402ffa2bd13e92f75247c75b9","observation_id":"1ad71774-beb3-43d1-9c46-8f1b44452bf0","resolution":{"observed_at":"2026-08-11T05:24:17.801306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.969336Z","title":"Playertv: Advanced player tracking and identification for automatic soccer highlight clips, 2024","venue":null,"work_id":"17252c0e-5dbc-4ca6-a9a9-e980e344b29c","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.804672Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:4a6a107137dc8e5c26798a08852ba35120efe1212197f09cbf9ac1b87bb4e655","observation_id":"22ceb1ea-6e79-4b8f-a840-4c7cec682770","resolution":{"observed_at":"2026-08-11T05:24:17.973119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.959321Z","title":"Internvl2: Better than the best—expanding performance boundaries of open-source multimodal models with the progressive scaling strategy","venue":null,"work_id":"56877029-68b9-43f6-8483-1dfec78129eb","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.808227Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:7a3aa279c808789aae6dbf834f5c9e39502b0a4e119677859c71023c2e0acd76","observation_id":"0e4d8d06-c469-4c5d-b539-8f68e0a4bde8","resolution":{"observed_at":"2026-08-11T05:24:17.962914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1411.5726","last_updated":"2015-06-03T01:42:20Z","snapshot_observed_at":"2026-08-07T17:52:59.562945Z","submitted_at":"2014-11-20T23:54:35Z","title":"CIDEr: Consensus-based Image Description Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.5726","snapshot_observed_at":"2026-08-11T05:24:17.811515Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.811515Z"},"links":{"cited_paper":"/paper/1411.5726","citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:13f00b1d2ff46a036d94eeffa061a6e9d6da2217409e3d93c9c140a0c1a240b6","observation_id":"712f6b79-4947-472c-a454-94d31e375393","resolution":{"observed_at":"2026-08-11T05:24:17.811515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.815018Z","title":"Lvbench: An extreme long video understanding benchmark, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.815018Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:acb0df5e0e3ec74c5a0678283ca6b0252efd64db96ec1058d6a5b4a3319d030d","observation_id":"48281dc9-9464-4065-9549-cac8cc4408b2","resolution":{"observed_at":"2026-08-11T05:24:17.815018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.818259Z","title":"Chain-of-thought prompting elicits reasoning in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.818259Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:55349c218ea078ba3ff85048194ce9db70a2012fb8a8b5668eac817bb799fcc5","observation_id":"9138a27a-d2d9-4035-8d99-52e1913656b4","resolution":{"observed_at":"2026-08-11T05:24:17.818259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.938418Z","title":"Sportshhi: A dataset for human-human interaction detection in sports videos, 2024","venue":null,"work_id":"2255e99e-a7b1-40ee-aa5a-fd5f7f51f5fe","year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.821236Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:a3451c930da83913212067add3d6bd0c41c36838c0fe8e8134760f3b17ef33aa","observation_id":"2b9fd42c-5dab-4c68-852f-ececbfabeb6a","resolution":{"observed_at":"2026-08-11T05:24:17.941986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.929242Z","title":"Next-qa:next phase of question-answering to explaining temporal actions","venue":null,"work_id":"061ce486-ffd4-47ac-aa8e-143301089fe3","year":2021},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.824496Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:c2dfac0bde6e3b061c7982ce836080db846d8ece235a63a3b2c198dba68b7a4a","observation_id":"191afc41-22d3-4cb1-8203-7215a9c1bc65","resolution":{"observed_at":"2026-08-11T05:24:17.932170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.919972Z","title":"Video question answering via gradually refined attention over appearance and motion","venue":null,"work_id":"b402fe5b-c51f-4e3d-ab8e-0f9ce82b6e73","year":2017},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.827835Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:d5acb2e3704408cff0cd5fe302cd0a1051b180647d31ed77af411c38dd309f51","observation_id":"5a12612e-03b0-4cd0-92ba-11cf5040ecb1","resolution":{"observed_at":"2026-08-11T05:24:17.923406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.908452Z","title":"Youku-mplug: A 10 million large-scale chinese video-language dataset for pre-training and benchmarks, 2023","venue":null,"work_id":"494b2757-71b0-468f-b000-1f4a0fa6917d","year":2023},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.830956Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:0a92bd3b98ea01bf78b8582d5eb280bc6ec2c198c1e1139782e91a7ef55c9db6","observation_id":"6ece9f76-4af6-42f9-8fe9-ec73996239ee","resolution":{"observed_at":"2026-08-11T05:24:17.913531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.834360Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.834360Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:8af6368d167b190e2816c1e0183133a5151c233c314c2bbedd4fc233ea767a08","observation_id":"2f72312a-1c0c-4b73-93f4-b98ac8a319bb","resolution":{"observed_at":"2026-08-11T05:24:17.834360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:24:17.837559Z","title":"Long context transfer from language to vision, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.837559Z"},"links":{"citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:1174e3d77800ab9d134170a186083e38bae4251688f653dd41e649a408dc1d2d","observation_id":"ec67df3c-0e60-44f4-b323-567b1480ea59","resolution":{"observed_at":"2026-08-11T05:24:17.837559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16038","last_updated":"2024-01-30T14:37:10Z","snapshot_observed_at":"2026-08-13T04:31:06.353491Z","submitted_at":"2024-01-30T14:37:10Z","title":"A Survey on Generative AI and LLM for Video Generation, Understanding, and Streaming","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16038","snapshot_observed_at":"2026-08-11T05:24:17.842065Z","title":"A survey on generative ai and llm for video generation, understanding, and streaming","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T05:24:17.842065Z"},"links":{"cited_paper":"/paper/2404.16038","citing_paper":"/paper/2412.17637"},"observation_digest":"sha256:ac272b27082f22629bfc3a6853e0c15cb9c94dcf9abcf601ab60eb20eb0f804e","observation_id":"f966328a-0266-435b-8b64-9392d51e1834","resolution":{"observed_at":"2026-08-11T05:24:17.842065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.17637","last_updated":"2024-12-23T15:13:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T05:16:25.777492Z","submitted_at":"2024-12-23T15:13:56Z","title":"SCBench: A Sports Commentary Benchmark for Video LLMs"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":29},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 2 inbound Pith citation observations for arXiv:2412.17637."}