{"as_of":"2026-08-19T11:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5ff0d5a3fd6b4b3ddf951571fa4f8afceb0cf532eae5e3157b9e4ed8aaf0c7a0","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:10:57.491105Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.03829/citation-record","integrity":"/paper/2505.03829/integrity","json":"/paper/2505.03829/citation-record.json","paper":"/paper/2505.03829"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.699497Z","title":"Frozen i n time: A joint video and image encoder for end-to-end retriev al,","venue":null,"work_id":"b1b4bfa7-916f-4d59-8a9f-27d740f027d0","year":2021},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.208332Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:c7b68e0a8ee2fe9d4cefc9df01935de82fe0febd71131e8311c4f83d63cffa2e","observation_id":"0457cecf-8f81-4e45-bb37-3fb973083e06","resolution":{"observed_at":"2026-08-16T04:10:58.703017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.686620Z","title":"Scale invariant feature transform,","venue":null,"work_id":"d6f17a8a-f50d-46e3-b521-94e3df22b746","year":null},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.212724Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:06b040451987100ede4fc408729a4984c23b6a34332b2c95c66224914539dfc6","observation_id":"08461a35-ad1d-4559-8d15-2fd6d89cff1a","resolution":{"observed_at":"2026-08-16T04:10:58.691096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.674273Z","title":"Speeded-u p ro- bust features (surf),","venue":null,"work_id":"d06aabd3-cac7-47ff-9a55-31d000567f34","year":2008},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.216370Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:bf408810a9be3e8d96cd5389254e158d598caa60802fa0c3a02b05ed88c8af99","observation_id":"f47cd2e7-f2a0-4bea-82c1-7e31ea624775","resolution":{"observed_at":"2026-08-16T04:10:58.678497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.661154Z","title":"Histograms of oriented gradient s for human detection,","venue":null,"work_id":"78290d9d-5d12-4358-bdb1-aaa9c1577a05","year":2005},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.220205Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:d1a0c529dc411f55113bd05e8c2b8e32d28ca721def277178b5731f2383b9d79","observation_id":"d9163e71-2ed7-4c94-a706-223aa3952cf9","resolution":{"observed_at":"2026-08-16T04:10:58.665742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.648423Z","title":"Large-scale video classiﬁcation with conv olu- tional neural networks,","venue":null,"work_id":"03eb2470-82e9-4688-8346-3bb84bc3a95d","year":2014},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.223893Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:b53d65ab1a5c20d5332d6f7f8baebc4e2e73aebe07cdbff40af79b04c27fdf68","observation_id":"c413d45f-92cf-49bd-8da6-6fbfd18877e0","resolution":{"observed_at":"2026-08-16T04:10:58.651998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.636408Z","title":"Convoluti onal two-stream network fusion for video action recognition,","venue":null,"work_id":"d00530ef-7ae2-4efe-9f87-2d3399a0559a","year":2016},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.227558Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:83c93e8af6b6c73941ba51ae5126fe2e1c3620b10b9e1c09e67e839c0f562e8c","observation_id":"3be2e011-c426-4941-bea1-b8889489d7e1","resolution":{"observed_at":"2026-08-16T04:10:58.640500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.624001Z","title":"Videobert: A joint model for video and language representa - tion learning,","venue":null,"work_id":"b02a3a8c-8758-41c3-8094-825f8f7b5312","year":2019},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.231096Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:4869211242ee92e9a30ad0f05e6db2e032c20f8001ef49d4a40b1de725807d4d","observation_id":"7a15fdf0-f206-4377-9ab6-0c3dfe524e7c","resolution":{"observed_at":"2026-08-16T04:10:58.628095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.611615Z","title":"Videomae: Masked autoencoders are data-efﬁcient learners for self-supervi sed video pre-training,","venue":null,"work_id":"419ec2fa-8c2e-4f7f-8f7e-f031ba2de5f5","year":2022},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.235248Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:1bf8029851172954b9f107a6ef0654353dd02a1da910ca79e0e504c6bc9456a5","observation_id":"cc9c0b22-75d0-42a1-9682-af326be4f67b","resolution":{"observed_at":"2026-08-16T04:10:58.615844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-16T04:10:57.238581Z","title":"Video-llama: An instructio n- tuned audio-visual language model for video understanding ,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.238581Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:e1ea170ee98a6f5086fb406db66149420c1ed0befc15879ee38d125848fcf1f4","observation_id":"b3cbbc0d-6946-45bb-b1f7-40f56455398b","resolution":{"observed_at":"2026-08-16T04:10:57.238581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-16T04:10:57.242459Z","title":"Videochat: Chat-centric video under- standing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.242459Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:4a020bddc7f8b20c975c0652484f0e07658502ffc75e2629797611a6228b15bf","observation_id":"41a4c077-2842-4e92-b2c1-95f2903988ef","resolution":{"observed_at":"2026-08-16T04:10:57.242459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-16T04:10:57.246180Z","title":"Video- chatgpt: Towards detailed video understanding via large vi sion and language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.246180Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:32cbcb3031faa44c0aa20827dfd5386923d1181fbae00c980c552e15714b6af0","observation_id":"30905b2d-f513-41b6-a5b6-a3fb1bc79228","resolution":{"observed_at":"2026-08-16T04:10:57.246180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:57.250137Z","title":"Video understanding with large language models: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.250137Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:c61828a89d16acd7d0dac52adb7edfe72310a3208a3bf1d7d2816324d19b2224","observation_id":"7ffd5089-4f02-4cc0-9353-71b6d8632fed","resolution":{"observed_at":"2026-08-16T04:10:57.250137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.598107Z","title":"Video question answering via gradually reﬁned attention o ver appearance and motion,","venue":null,"work_id":"82948367-6492-475f-a355-12cf2b2cab77","year":2017},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.253389Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:3067f247b92afd7fa7af14a0bb53dfbe7f6fb8b5d475b21a8af54cb14a79f5ff","observation_id":"9a52db01-2d9f-4b38-850f-5d805656a4a6","resolution":{"observed_at":"2026-08-16T04:10:58.602266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.586269Z","title":"Tgif-qa: Toward spatio-temporal reasoning in visual question answering,","venue":null,"work_id":"54070aa5-2675-4837-a310-f25346cffaff","year":2017},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.256649Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:d82a3a6a6cc0ce61ded9ac237e6cf15cbae94fe3700ea523e0bd514c20d8f8bd","observation_id":"0c4efde5-f176-4d14-9ce3-6a915556c71a","resolution":{"observed_at":"2026-08-16T04:10:58.590327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.572470Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering,","venue":null,"work_id":"c01dc503-b6a3-4fd1-8c79-9aecbc90c392","year":2019},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.259980Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:9c85ea50f23a9ca5902117d36da429cf3fd435439e84d8412e1635e3c936b0f5","observation_id":"0af542e8-025b-4f0c-9876-975dac7eafbd","resolution":{"observed_at":"2026-08-16T04:10:58.577932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.560622Z","title":"Tvqa: Localized , compositional video question answering,","venue":null,"work_id":"096f927e-eb54-42eb-abf9-94652ef1b983","year":2018},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.263310Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:fcbaad30f12e223941a4833df23e7b7e9fcb7411467e24642b4f4978d0e8567b","observation_id":"989723b7-7e4a-43e2-8960-6215ec44ad74","resolution":{"observed_at":"2026-08-16T04:10:58.564643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.548195Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark,","venue":null,"work_id":"b3764668-f198-41c3-8bc7-6d677c5f84dd","year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.266599Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:c834e3f88c38a8f829c9d6b7b9c2a554a0bcc37afd49fb1e001fb7ed283fa8e2","observation_id":"a7584a48-4dff-44f8-b212-2f08c75fafcc","resolution":{"observed_at":"2026-08-16T04:10:58.552326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16103","last_updated":"2023-11-28T18:16:29Z","snapshot_observed_at":"2026-08-16T14:39:55.654977Z","submitted_at":"2023-11-27T18:59:58Z","title":"Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16103","snapshot_observed_at":"2026-08-16T04:10:57.270051Z","title":"Video-bench: A comprehensive benchmark and toolkit for evaluating video-based large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.270051Z"},"links":{"cited_paper":"/paper/2311.16103","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:16ae4171b70279dc3066653189952e7bae9451afcc1910cb9787fe7ffb40cbf2","observation_id":"c5e18990-fa29-4d29-abe7-3ec904d7cc23","resolution":{"observed_at":"2026-08-16T04:10:57.270051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11303","last_updated":"2024-06-17T08:09:00Z","snapshot_observed_at":"2026-08-16T13:42:22.602032Z","submitted_at":"2024-06-17T08:09:00Z","title":"VideoVista: A Versatile Benchmark for Video Understanding and Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11303","snapshot_observed_at":"2026-08-16T04:10:57.273744Z","title":"Videovista: A versatile benchmark for video understandin g and reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.273744Z"},"links":{"cited_paper":"/paper/2406.11303","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:c66f912c2bbde6d85171105b864625d8cf2532324a54ae883291b269b1d589cc","observation_id":"7827d522-bce2-400e-8df6-f4151b52fb7f","resolution":{"observed_at":"2026-08-16T04:10:57.273744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08813","last_updated":"2024-10-21T03:08:08Z","snapshot_observed_at":"2026-08-17T14:14:30.066593Z","submitted_at":"2024-05-14T17:59:02Z","title":"CinePile: A Long Video Question Answering Dataset and Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08813","snapshot_observed_at":"2026-08-16T04:10:57.278096Z","title":"Cinepile: A long video question answer- ing dataset and benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.278096Z"},"links":{"cited_paper":"/paper/2405.08813","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:354cccbb193935eb06b44435a65cc3af63ca58b21d36b1a22537f6cb26051ac3","observation_id":"c93d0d5f-e557-431d-a3fc-a6eb6398a25a","resolution":{"observed_at":"2026-08-16T04:10:57.278096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:57.281659Z","title":"Inﬁnibench: A comprehensive benchmark for large multimodal models in very long video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.281659Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:ff03da0d9564c9c55189ba05014b032233303d63688a64c0ae3c703d161ac987","observation_id":"2f64fe3f-2e34-4a4d-a9d6-34680788f4f0","resolution":{"observed_at":"2026-08-16T04:10:57.281659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-12T14:24:43.915700Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-08-16T04:10:57.285229Z","title":"Tempcompass: Do video llms really understand videos?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.285229Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:92aa3cab5e3454a7653ded6fea93bc3dadfc013653775e5c4576483b7957ebeb","observation_id":"e5c30a6e-22c3-471e-9472-771585ae9e31","resolution":{"observed_at":"2026-08-16T04:10:57.285229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.535696Z","title":"Her o: Hierarchical encoder for video+ language omni-representa tion pre-training,","venue":null,"work_id":"7bda989a-9131-446c-b633-33acc3e80ee5","year":2020},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.288735Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:19b90726ae69f41fb22432a6eba708cc4bb2e53fe90b3b27d12059ebdfe0c873","observation_id":"9af3a1e1-5d5b-44c1-aca3-b62ad2d63219","resolution":{"observed_at":"2026-08-16T04:10:58.539725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.523946Z","title":"Star: A benchmark for situated reasonin g in real-world videos,","venue":null,"work_id":"f44ef69e-3d35-4e8d-b082-832a91d93bd3","year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.292147Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:84c60d74ccacea8a53d92e25e87b6df77e91a57fefc5e9b629a1d0fd1d1bd3e8","observation_id":"a38e6837-e11d-4e71-910b-0a895c294139","resolution":{"observed_at":"2026-08-16T04:10:58.527959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09126","last_updated":"2023-08-17T17:59:59Z","snapshot_observed_at":"2026-08-16T15:07:45.447539Z","submitted_at":"2023-08-17T17:59:59Z","title":"EgoSchema: A Diagnostic Benchmark for Very Long-form Video Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09126","snapshot_observed_at":"2026-08-16T04:10:57.295597Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.295597Z"},"links":{"cited_paper":"/paper/2308.09126","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:453e61f85e4c884cd212b582089cbe4115dee7b832508c150ce29c68387b9fcd","observation_id":"2942772e-a2f3-4211-b5d8-6c2a222f5199","resolution":{"observed_at":"2026-08-16T04:10:57.295597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.511257Z","title":"Autoeval-video : An automatic benchmark for assessing large vision language mo d- els in open-ended video question answering,","venue":null,"work_id":"7c5250a8-c59e-4e3a-bfca-3bb1b37f9bae","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.299508Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:71abf27cacccc0bfd707c942dbd3ae05a602606f9725e6f4bcb5d3dd612c9578","observation_id":"53072aab-6734-4f68-9aa4-25c5fdc9f789","resolution":{"observed_at":"2026-08-16T04:10:58.515745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-16T04:10:57.302910Z","title":"Video-mme: The ﬁrst- ever comprehensive evaluation benchmark of multi-modal ll ms in video analysis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.302910Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:a410b2934f124d4909735d0e23a7529ed75c71cbb798cc8c68cdb49fc6e68485","observation_id":"cdde5b75-7588-402e-a959-a055637c308a","resolution":{"observed_at":"2026-08-16T04:10:57.302910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.498774Z","title":"Sok-bench: A situated video reasoning bench - mark with aligned open-world knowledge,","venue":null,"work_id":"563d0873-5d4a-47ee-a1e3-9964e7bb882b","year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.306568Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:ebd50e1160a6f9f24032cff5eca414b560b19570569504f1220de21a680f32e2","observation_id":"1ffb5038-5031-4671-9b6f-8c6c32ed87b6","resolution":{"observed_at":"2026-08-16T04:10:58.502546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10221","last_updated":"2025-01-10T10:36:58Z","snapshot_observed_at":"2026-08-16T13:42:51.584614Z","submitted_at":"2024-06-14T17:54:54Z","title":"Long Story Short: Story-level Video Understanding from 20K Short Films","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10221","snapshot_observed_at":"2026-08-16T04:10:57.310180Z","title":"Short ﬁlm dataset (sfd): A benchmark for story-level video understan ding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.310180Z"},"links":{"cited_paper":"/paper/2406.10221","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:8d18be8eeeee10834f7cd34f6985f4e594cbf3bd64eb6c757244764c530f37ce","observation_id":"96461d7b-a7ae-465d-9552-ea619cb64dde","resolution":{"observed_at":"2026-08-16T04:10:57.310180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-16T04:10:57.313889Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.313889Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:922c2d10231b347f0a9917d297e2f59edd30f7d01c23f3ed65ff7eaaace7f140","observation_id":"e7847b22-1578-4fe9-9df3-5e32153a7437","resolution":{"observed_at":"2026-08-16T04:10:57.313889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08407","last_updated":"2024-07-30T03:15:55Z","snapshot_observed_at":"2026-08-16T13:43:39.575307Z","submitted_at":"2024-06-12T16:54:54Z","title":"MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08407","snapshot_observed_at":"2026-08-16T04:10:57.317505Z","title":"Mmworld: Towards multi-discipline multi-faceted world model evaluation in videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.317505Z"},"links":{"cited_paper":"/paper/2406.08407","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:4dc07b3c347ca28d3ad6e776d954813dde1beb1ef1a77453941bf010ac6f0ff9","observation_id":"bb73934b-8e76-4fc1-ad34-f7ff3b48399b","resolution":{"observed_at":"2026-08-16T04:10:57.317505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10889","last_updated":"2025-03-30T14:07:22Z","snapshot_observed_at":"2026-08-16T13:42:36.770737Z","submitted_at":"2024-06-16T10:42:21Z","title":"VELOCITI: Benchmarking Video-Language Compositional Reasoning with Strict Entailment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10889","snapshot_observed_at":"2026-08-16T04:10:57.321005Z","title":"V elociti: Can video-language models bind sema n- tic concepts through time?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.321005Z"},"links":{"cited_paper":"/paper/2406.10889","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:42ee90312b205239d53189d0544f40f2192522c997213554b5408bca04bfd5ec","observation_id":"26e35818-4686-46ba-bc00-b8fa21d25181","resolution":{"observed_at":"2026-08-16T04:10:57.321005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.486971Z","title":"Next-qa: Next phase of question-answering to explaining temporal action s,","venue":null,"work_id":"86e435b4-26e2-408c-8872-1fc489439956","year":2021},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.325091Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:babeead79343e469566ff5b0dda979529c6eb2b74e286eba803dcb006ded1799","observation_id":"3f093539-0a41-4e41-8255-28fbf86fa408","resolution":{"observed_at":"2026-08-16T04:10:58.490657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10484","last_updated":"2024-09-27T02:47:55Z","snapshot_observed_at":"2026-08-16T13:42:47.062039Z","submitted_at":"2024-06-15T03:28:52Z","title":"Beyond Raw Videos: Understanding Edited Videos with Large Multimodal Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10484","snapshot_observed_at":"2026-08-16T04:10:57.328774Z","title":"Beyond raw videos: Understand- ing edited videos with large multimodal model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.328774Z"},"links":{"cited_paper":"/paper/2406.10484","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:fd0fd09ef0017d3a8ed87b2d3b1fba5b0f51bd533e8010d2ee9cb3d1ba636c5e","observation_id":"4ff75dd1-8b15-4161-9509-23de8554df3d","resolution":{"observed_at":"2026-08-16T04:10:57.328774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.475387Z","title":"Cider : Consensus-based image description evaluation,","venue":null,"work_id":"7ecfc806-6ef4-4de9-83bb-71a36ac6d601","year":2015},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.332438Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:551fab5a40c466ff9f86b09ac4b101f5b9171dd303c5419677555475a98b7b53","observation_id":"a0758e65-dd60-454b-98ff-1f843bd22dc0","resolution":{"observed_at":"2026-08-16T04:10:58.479156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.461779Z","title":"Meteor: An automatic metric f or mt evaluation with improved correlation with human judgments ,","venue":null,"work_id":"3c7ef8ff-cad2-4259-a243-23f7abd70de2","year":2005},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.336309Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:ebebc6f393db22a8b0679e29821a3586077abda0d3010dd4e6cb228316a71116","observation_id":"b2f1fe92-9012-40ad-9d96-a9bd2b7d64bb","resolution":{"observed_at":"2026-08-16T04:10:58.466039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.449728Z","title":"Rouge: A package for automatic evaluation o f summaries,","venue":null,"work_id":"e2a17132-2bae-4cc5-9816-604b3d6703d2","year":2004},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.340100Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:09febe83a3bc4ce8de467aeed89e200fb65317cf688fa482165c12d9591a0a18","observation_id":"8aaee166-238b-4fa2-97d3-7415a0172be5","resolution":{"observed_at":"2026-08-16T04:10:58.453481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.434234Z","title":"Spi ce: Semantic propositional image caption evaluation,","venue":null,"work_id":"d794f2d1-e6da-40cd-8ba8-592e99d474a8","year":2016},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.343546Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:981cf9bed2039307a48a07488165fa8750891b9962f7eab2ff63ea58e21d9047","observation_id":"10154545-9f00-4c87-ac65-3385c473647a","resolution":{"observed_at":"2026-08-16T04:10:58.439700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-08-13T20:40:43.794560Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-16T04:10:57.348050Z","title":"Plla va: Parameter-free llava extension from images to videos for vi deo dense captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.348050Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:431fd4bd001f225fff763b4a6cf9056616009ae80ac45c7ef733b733dd7352a6","observation_id":"fd49f749-fda1-418d-b0aa-5a11e99e2bac","resolution":{"observed_at":"2026-08-16T04:10:57.348050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.422178Z","title":"An image grid can be worth a video: Zero-shot video question answering using a vl m,","venue":null,"work_id":"c472088b-d404-4406-ac1b-044884798951","year":null},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.351876Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:f046a8974bead69304155f716fbdc262284e9b39cb0482c376c06ca870637e73","observation_id":"c8bdc7b7-d4f6-42e8-a55c-a5f99ed9d973","resolution":{"observed_at":"2026-08-16T04:10:58.426279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00308","last_updated":"2024-03-30T10:11:26Z","snapshot_observed_at":"2026-08-16T14:05:01.885851Z","submitted_at":"2024-03-30T10:11:26Z","title":"ST-LLM: Large Language Models Are Effective Temporal Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00308","snapshot_observed_at":"2026-08-16T04:10:57.360169Z","title":"St-llm: Large language models are effective temporal learners,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.360169Z"},"links":{"cited_paper":"/paper/2404.00308","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:b6074ee7d543d612319e4062640261493ded44971a47182f7e655f130f4ecc68","observation_id":"1551d931-4d42-4c77-a1fa-faee1b5e021d","resolution":{"observed_at":"2026-08-16T04:10:57.360169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06573","last_updated":"2023-10-19T23:45:30Z","snapshot_observed_at":"2026-08-16T15:48:57.108651Z","submitted_at":"2023-03-12T05:08:16Z","title":"Large Language Models Know Your Contextual Search Intent: A Prompting Framework for Conversational Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06573","snapshot_observed_at":"2026-08-16T04:10:57.363973Z","title":"Large language models know your contextual search intent: A prompting framework for conversational search,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.363973Z"},"links":{"cited_paper":"/paper/2303.06573","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:d352d1ab77a8a1aa054123e72af12290aa8d3d404689c972f66adfd4a27ae21e","observation_id":"a25d3613-5ba0-47bf-8b3b-1bf2ccbb4ac0","resolution":{"observed_at":"2026-08-16T04:10:57.363973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.395388Z","title":"Prompting visual-language models for efﬁcient video understanding,","venue":null,"work_id":"14a720fc-86c5-48df-9938-63e8e253e05f","year":2022},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.367703Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:fd779fcc6d3d659bd53f81366abbb51e73263d17fa78fd744d11d3b67edc949c","observation_id":"97e10699-b042-47b8-bdf9-ceb03bcaac73","resolution":{"observed_at":"2026-08-16T04:10:58.401414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.383348Z","title":"Vid2seq: Large-scale pr e- training of a visual language model for dense video captioni ng,","venue":null,"work_id":"21c977c0-94d1-41b3-9538-d06cb79039c1","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.370935Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:225b1d900798e8cfb8152ef86e5d7adfde380133b1b26eb86a69a923ad856b80","observation_id":"2c694bcf-fb46-454a-a33d-b2ea7fe61535","resolution":{"observed_at":"2026-08-16T04:10:58.387048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.366858Z","title":"Lea rning video representations from large language models,","venue":null,"work_id":"6c656cae-db9b-47f6-99d8-699b41fb7aa9","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.374152Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:fd8fa5460ceb25b47d8397325a895665cebe79043d7682f7fcf0df80272dcb87","observation_id":"7a2d283b-0723-4264-bda1-06c3f4fa4d38","resolution":{"observed_at":"2026-08-16T04:10:58.375575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12218","last_updated":"2023-05-20T15:48:47Z","snapshot_observed_at":"2026-08-16T15:31:28.474878Z","submitted_at":"2023-05-20T15:48:47Z","title":"Text-Video Retrieval with Disentangled Conceptualization and Set-to-Set Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12218","snapshot_observed_at":"2026-08-16T04:10:57.377738Z","title":"Text-video retrieval with disentangled conceptu aliza- tion and set-to-set alignment,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.377738Z"},"links":{"cited_paper":"/paper/2305.12218","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:73728e63c1174d1a70d9e161d7f069d8b26e3ddbc17f34c3380104c28039eb3f","observation_id":"dd2bf198-3261-463e-9b15-da47f779f920","resolution":{"observed_at":"2026-08-16T04:10:57.377738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09867","last_updated":"2023-08-19T08:31:57Z","snapshot_observed_at":"2026-08-16T15:47:27.796591Z","submitted_at":"2023-03-17T10:07:19Z","title":"DiffusionRet: Generative Text-Video Retrieval with Diffusion Model","version":2},"cited_work":{"arxiv_id":"2303.09867","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.09867","snapshot_observed_at":"2026-08-16T04:10:57.615082Z","title":"DiffusionRet: Generative Text-Video Retrieval with Diffusion Model","venue":"cs.CV","work_id":"fe3864f3-2a4c-431e-ae74-9239c295d28c","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.381159Z"},"links":{"cited_paper":"/paper/2303.09867","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:0507ab6d04b0541a35aeb6572c8deec4c987e12c7ea8584a6eb0e6575eaf1784","observation_id":"cff9b54f-1fd1-4f1a-b1c0-b7d5f4637841","resolution":{"observed_at":"2026-08-16T04:10:57.621559Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.347268Z","title":"Egovlpv2: Egocentric vid eo- language pre-training with fusion in the backbone,","venue":null,"work_id":"6b94b533-2755-47d1-bd83-5156e0c193ab","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.384947Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:1927cd6ee4f494cd3365a32331cf9174a9ca3c3a4276dd6f59fe794bfff68566","observation_id":"632fe7bf-dc07-41d9-bc93-a9f8f9c48c9d","resolution":{"observed_at":"2026-08-16T04:10:58.354358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13160","last_updated":"2023-11-22T05:04:20Z","snapshot_observed_at":"2026-08-16T14:41:17.375464Z","submitted_at":"2023-11-22T05:04:20Z","title":"Large Language Models in Education: Vision and Opportunities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13160","snapshot_observed_at":"2026-08-16T04:10:57.389050Z","title":"Large language models in education: Vision and opportunities,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.389050Z"},"links":{"cited_paper":"/paper/2311.13160","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:f620add5c9a25866af71923d004369ee0117611f7709ea9ed4888be2a7c6828f","observation_id":"a5c85418-434c-423a-b6db-6a8a8141fbf2","resolution":{"observed_at":"2026-08-16T04:10:57.389050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08849","last_updated":"2023-08-17T08:15:51Z","snapshot_observed_at":"2026-08-16T15:07:53.405696Z","submitted_at":"2023-08-17T08:15:51Z","title":"A Survey on Deep Multi-modal Learning for Body Language Recognition and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08849","snapshot_observed_at":"2026-08-16T04:10:57.392691Z","title":"A survey on deep multi-modal learning for body language recognition and generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.392691Z"},"links":{"cited_paper":"/paper/2308.08849","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:1d370608ae84e21da2eb56a476a3a6edc2a7543348cfd5176a3ff8ce7e480b7a","observation_id":"f6de4c2e-beb7-459c-bb93-36834d7552ca","resolution":{"observed_at":"2026-08-16T04:10:57.392691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.334817Z","title":"Machine translation from signed to spoken lan- guages: State of the art and challenges,","venue":null,"work_id":"f0e15f44-d7c8-4303-ac81-caa00be4cc15","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.396186Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:4da506ba1e3acbd17434479be68bb2bf71f57b6aa9916d0cc9076221e48562c8","observation_id":"8c8c58cb-9c19-452d-b9ac-4f52344f1e7a","resolution":{"observed_at":"2026-08-16T04:10:58.339055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.321634Z","title":"Generating video game quests from storie s,","venue":null,"work_id":"12d69116-ab67-4785-bd6d-0c20b0de3702","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.399555Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:266e2a06c65ea3b66d68184a46f41bfe10f740d2da7f1e31ce949fabd4a319a0","observation_id":"6a583ddb-c0bb-45c5-af0f-16802d2cc2e7","resolution":{"observed_at":"2026-08-16T04:10:58.325720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.309349Z","title":"Text generation for quests in multiplayer r ole- playing video games,","venue":null,"work_id":"5188f502-da71-4766-9473-4d89d9db12fa","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.402915Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:290a9ea5b9e9f80946637cc19a1e7cae871f28448c00337953ab0c7dd74bfa91","observation_id":"2b6d144f-71e8-4bca-baf9-e27bb6d3d6d5","resolution":{"observed_at":"2026-08-16T04:10:58.313403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.297299Z","title":"The role of artiﬁcial intelligence and robotic solution technologies in metaverse design,","venue":null,"work_id":"b5d22cad-6574-4766-b177-0dcd169c7c69","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.406452Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:19beff4d9c1842206f6f6681ea3f4c831c623d7c0ae8f8ac0e109810c1b271b1","observation_id":"fa00f981-94d5-49b8-bf36-108fb955f490","resolution":{"observed_at":"2026-08-16T04:10:58.301198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.285506Z","title":"Jung and M","venue":null,"work_id":"370b7cc1-3d6d-49b2-903a-808515295bda","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.409962Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:0737c212fa367219ab6199162d23a53e2a44636600fda29bc043cf4143e9cbf6","observation_id":"38d1517d-d868-411a-93f5-6e9df3ab346d","resolution":{"observed_at":"2026-08-16T04:10:58.289191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16785","last_updated":"2024-10-10T16:09:22Z","snapshot_observed_at":"2026-08-16T13:49:13.281248Z","submitted_at":"2024-05-27T03:13:28Z","title":"PromptFix: You Prompt and We Fix the Photo","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16785","snapshot_observed_at":"2026-08-16T04:10:57.414062Z","title":"Promptﬁx: Y ou prompt and we ﬁx the photo,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.414062Z"},"links":{"cited_paper":"/paper/2405.16785","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:9bdc134d4612aa3874a5626d038b08aaa241abd01b6a60f4c4d5b022b1536732","observation_id":"03b6e04c-908e-4e08-8cd0-44e0d4ecfe61","resolution":{"observed_at":"2026-08-16T04:10:57.414062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.273055Z","title":"Egocentric audio - visual object localization,","venue":null,"work_id":"bc702021-9704-4248-ae9c-089bc6b2c679","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.418116Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:9dd90bb17e5f47fc9eea139ccccea4c1f411d3d88d30560c407f83a2c9da62f2","observation_id":"c134139c-ac6a-4450-98f7-d5590369b4a2","resolution":{"observed_at":"2026-08-16T04:10:58.277305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.260448Z","title":"Misar: A multimodal instructional system with augmented reality,","venue":null,"work_id":"065331cc-3b2f-40f1-9434-852ac258c477","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.421836Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:6f835e5d63373ef7699a8a42de11220e61192ad11ec2ba34c219a3b30d244c5a","observation_id":"abc99f2a-1a97-4173-b087-98960b9c1f2a","resolution":{"observed_at":"2026-08-16T04:10:58.264739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.247738Z","title":"Sayplan: Grounding large language models using 3d scene graphs for scalable robot task planning,","venue":null,"work_id":"a306cb4f-3e4c-47b3-b40b-eea0c43f0ddf","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.426486Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:5a51277d854b8541589913118c1e7458fe24af15fe84efab854ae663168220f9","observation_id":"123e926d-2a69-4728-9ee5-95ae57077aa7","resolution":{"observed_at":"2026-08-16T04:10:58.252034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.234997Z","title":"The role of chatgpt, generative language models, and artiﬁcial intelligence in medical education: a con- versation with chatgpt and a call for papers,","venue":null,"work_id":"c7a03a3d-e881-4bfd-aaff-d830d2cf73d9","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.430221Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:f4f0538188ab326a7109aa6727bd6beff5e507945a2abba86fee508cbf9f3b73","observation_id":"84041543-f715-41ec-bf3a-d5a94720c217","resolution":{"observed_at":"2026-08-16T04:10:58.239305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.221106Z","title":"Beat: A large-scale semantic and emotional multi-modal dataset for conversational gestures synthesi s,","venue":null,"work_id":"6d66463f-fdba-4fff-a0da-883ff11c23a0","year":2022},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.434122Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:39a1c97bd60690a8ad4a7fe349ed64cde7678313120780eac62461c36a6c70c1","observation_id":"b699bdf1-e3ec-4f01-b360-88270bb966f3","resolution":{"observed_at":"2026-08-16T04:10:58.225749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.208464Z","title":"Disco: Disentangled implicit content and rhythm learning for diverse co-speech gestures synthesis,","venue":null,"work_id":"04ca33d5-1510-4145-be29-1bd510c6a875","year":2022},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.438175Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:f8a085d5a9a14d51112187e09b058242fdedfcfbbba912ff24d80a712495debf","observation_id":"f21a76c5-1eef-4af4-8019-227a4c0556d3","resolution":{"observed_at":"2026-08-16T04:10:58.212875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.194397Z","title":"Emage: Towards uni- ﬁed holistic co-speech gesture generation via expressive m asked audio gesture modeling,","venue":null,"work_id":"e3687cca-da61-474e-a57e-346d5e5c9826","year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.442033Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:8158a1225c7904531e54e453f7acb9830ba7e45b3622eda5ab4e35b284c87272","observation_id":"fb50e9a4-e2e1-4316-bc52-5881bca592d5","resolution":{"observed_at":"2026-08-16T04:10:58.198635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00890","last_updated":"2023-06-01T16:50:07Z","snapshot_observed_at":"2026-08-09T05:23:28.778360Z","submitted_at":"2023-06-01T16:50:07Z","title":"LLaVA-Med: Training a Large Language-and-Vision Assistant for Biomedicine in One Day","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00890","snapshot_observed_at":"2026-08-16T04:10:57.445714Z","title":"Llava-med: Training a large language-and-vision assistant for biomedicine in one day,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.445714Z"},"links":{"cited_paper":"/paper/2306.00890","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:5d6e5060b511b8d974e2ef488d6004172e4b65b213c5e3e96e4267fa5fd4f7f9","observation_id":"087c594f-de19-4643-8fa2-ac170830ed03","resolution":{"observed_at":"2026-08-16T04:10:57.445714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.180183Z","title":"Chatgpt for cybersecurity: practical applications, challenges, a nd future directions,","venue":null,"work_id":"ba3eba56-cc53-4888-bacd-3503af643b44","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.450162Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:b365b4c143d915b9696001469139714506ae1c566fbb7cc55d477a1ba811ca92","observation_id":"06414b93-953f-4053-9c7d-8f9bec932fbf","resolution":{"observed_at":"2026-08-16T04:10:58.185033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.167868Z","title":"Modelling language for cyber security incide nt handling for critical infrastructures,","venue":null,"work_id":"45ae1296-293d-4a4d-a944-e667d75915d7","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.454103Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:a780584163938bd04216c4c83008eb4f3d75ee2992cf86ebfae48375752ba0f8","observation_id":"0c1196e5-1cc2-4c52-bc9e-6e5129f94096","resolution":{"observed_at":"2026-08-16T04:10:58.171783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.154876Z","title":"Socratic video un- derstanding on unmanned aerial vehicles,","venue":null,"work_id":"badb83b1-da9a-4349-82c6-a1359f00075b","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.457788Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:a2d3ba9f5b702a98fe54c8ad43ad868399aaa5a4e7599a1018c65d62494ed71e","observation_id":"d9c89dbe-87da-40c5-965a-458ee2a764e3","resolution":{"observed_at":"2026-08-16T04:10:58.159088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.141484Z","title":"Lanobert: System log anomal y detection based on bert masked language model,","venue":null,"work_id":"5b9ae1df-f411-4f23-b605-da197ec94b02","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.461676Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:5a3ce49b5bf064655af59a21c5902975e94cac4a49d6123769f6a139343a5ff6","observation_id":"337893e5-e600-47d2-901a-5c5eb9b5bce4","resolution":{"observed_at":"2026-08-16T04:10:58.146125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.128348Z","title":"Logﬁt : Log anomaly detection using ﬁne-tuned language models,","venue":null,"work_id":"ef81524b-e8e6-44f8-9a55-3e5a0cdcccc1","year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.465491Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:f5b740074314d098825f1ae2721a4d3ca448f3135a2fe223eb9aa09e4902f37d","observation_id":"9e006d68-503a-4a62-846d-b3740f65e80e","resolution":{"observed_at":"2026-08-16T04:10:58.132101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13023","last_updated":"2024-05-07T10:10:14Z","snapshot_observed_at":"2026-08-16T14:50:49.761494Z","submitted_at":"2023-10-19T06:17:46Z","title":"GraphGPT: Graph Instruction Tuning for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13023","snapshot_observed_at":"2026-08-16T04:10:57.469272Z","title":"Graphgpt: Graph instruction tuning for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.469272Z"},"links":{"cited_paper":"/paper/2310.13023","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:a57aeb5b6a3d60c1383688306fd0fe12be7805fa04cd03ff426e2ae89c388abe","observation_id":"51c40cc3-ebe4-498a-bd32-9c912e6b9c82","resolution":{"observed_at":"2026-08-16T04:10:57.469272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.115462Z","title":"Drive as you speak: Enabling human-like interaction with large lan- guage models in autonomous vehicles,","venue":null,"work_id":"765205e7-5f3d-4427-9663-964040bd3d37","year":2024},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.473276Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:929ad49d940917a113d4f97662c3d8cec863516803abd3780f425dda0acb3b89","observation_id":"16a4d9ce-1d6a-4f39-92a9-8840ec38568d","resolution":{"observed_at":"2026-08-16T04:10:58.119702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03726","snapshot_observed_at":"2026-08-16T04:10:57.477036Z","title":"Ott er: A multi-modal model with in-context instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.477036Z"},"links":{"cited_paper":"/paper/2305.03726","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:5882e9aac7923af3f9cc4ce9f998a83c42f8107e876b95153d5827d4ce6e48c5","observation_id":"873ee204-4992-4a7a-922b-a62edde51234","resolution":{"observed_at":"2026-08-16T04:10:57.477036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-16T15:11:32.772599Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-16T04:10:57.480975Z","title":"Lisa: Reasoning segmentation via large language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.480975Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:44d33b63eb3c07968265add839b0fd04ba7ef913f466cc2efeaefa22cf03d798","observation_id":"16568131-7681-421b-bfb1-1c9a22c477e4","resolution":{"observed_at":"2026-08-16T04:10:57.480975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.102218Z","title":"How retail video analytics enhances cust omer experience,","venue":null,"work_id":"d975052b-c90d-4ddb-ba7e-1e902a1cb0fc","year":2025},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.484416Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:efa774b05219284f6c06a17f26fa924708e6284f53bc6961431257742f27aa59","observation_id":"f2741f88-e54a-40dc-9562-72d60aef8840","resolution":{"observed_at":"2026-08-16T04:10:58.106588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.088736Z","title":"How video analytics is transform ing the luxury retail experience,","venue":null,"work_id":"04ad347c-8b7f-4bb8-ad8e-17e74e9fab29","year":2025},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.487821Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:e7c33742198b279720dc9ac72069e9310270111a16681f1cfb11738396863b83","observation_id":"720ed770-7920-462c-9723-62462dbb55b4","resolution":{"observed_at":"2026-08-16T04:10:58.093348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.074584Z","title":"Visual search and its growing inﬂuence on e-commerce,","venue":null,"work_id":"7cd6ae99-08da-467c-b82e-06549405213a","year":2018},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.491105Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:7c15064c2a171f4a9e10a49b2b0faa08cddd023dc4dadc9e2095f566c3bc1919","observation_id":"83ca2291-8e1f-48e6-aa14-dad7416d4a75","resolution":{"observed_at":"2026-08-16T04:10:58.079736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:10:58.410035Z","title":"Available: https://arxiv.org/abs/2403","venue":null,"work_id":"c254e302-4e88-411a-a6ea-e60f64114436","year":null},"citing_paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T04:10:57.356168Z"},"links":{"citing_paper":"/paper/2505.03829"},"observation_digest":"sha256:6e34ddd5214c4f970f60a2f306384c1ef6fcb57faa9ab92b8812b57c0ce3d003","observation_id":"34ed7320-45fb-4f0c-8dae-03e4858cd505","resolution":{"observed_at":"2026-08-16T04:10:58.414170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.03829","last_updated":"2025-05-03T20:56:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T22:31:29.205918Z","submitted_at":"2025-05-03T20:56:09Z","title":"VideoLLM Benchmarks and Evaluation: A Survey"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":49},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 0 inbound Pith citation observations for arXiv:2505.03829."}