{"as_of":"2026-08-05T11:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:33377dcdad9dba9d9e81517f2e01fe20496fcdd94eff53f2156e49ef33debe6f","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T01:43:34.898639Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.03276/citation-record","integrity":"/paper/2605.03276/integrity","json":"/paper/2605.03276/citation-record.json","paper":"/paper/2605.03276"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:79b31f03e21fee296f42d046c49422ad98b76acc5e25a511827a557544a0af48","observation_id":"36c2242c-c6f4-493b-9fc5-c85c78507edc","resolution":{"observed_at":"2026-05-12T01:46:13.946366Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-07-06T19:03:00.486641Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":"2408.10188","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-03T10:48:02.935874Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","venue":"cs.CV","work_id":"3b739755-b666-4189-88cc-5d999bb41a9c","year":2024},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:3c6e3021f33696fccb4030f3e2f4751a45d14984ce236b0d922fb9af8ef2cf14","observation_id":"046bbe7a-7f19-48b8-99b0-d3d23e3ab290","resolution":{"observed_at":"2026-05-17T03:51:25.572615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21374","last_updated":"2025-05-27T16:05:01Z","snapshot_observed_at":"2026-08-01T16:24:28.120659Z","submitted_at":"2025-05-27T16:05:01Z","title":"Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?","version":1},"cited_work":{"arxiv_id":"2505.21374","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.21374","snapshot_observed_at":"2026-07-04T16:39:58.338552Z","title":"Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?","venue":"cs.CV","work_id":"6d26f54b-33e5-4b18-86b0-7202ab41b867","year":2025},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"cited_paper":"/paper/2505.21374","citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:daddacd899ec54436cb592cea8c4fdd44352d1d8edbd56020baa1455af2d587b","observation_id":"9766c89d-524a-4dbe-9045-7ceadbe02802","resolution":{"observed_at":"2026-05-17T05:40:56.172131Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Routledge","venue":null,"work_id":"4fef7ab0-68e0-4560-b563-4cffa8c10016","year":2018},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:edb536e43f3d75f243a6699ed2a5aa5e2679ef96dbfcfcdee31c6a51fdc5fdfa","observation_id":"181d5190-dbb2-436b-afbf-31755d7a4053","resolution":{"observed_at":"2026-05-14T06:08:25.010414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Motion-grounded video reasoning: Understanding and perceiving motion at pixel level","venue":null,"work_id":"92231645-3a3e-4c4f-9606-0e0c8c2e2e14","year":2025},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:5e00af8346f435af2846eec5d7080ba1081460c5fa1b40793f5338a7fb4f1ce3","observation_id":"6a2909b4-03d3-4426-b70c-775ab0f8442e","resolution":{"observed_at":"2026-05-14T06:08:25.007343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.08559","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T07:16:45.184010Z","title":"arXiv preprint arXiv:2510.08559 , year=","venue":null,"work_id":"779add4b-7577-4fc1-bc17-dd9de76ce6ba","year":2025},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:578e75dadcc7f812b96618ba7be39abf2600820ba5f79c786aad78d7beece225","observation_id":"49f06259-5d2f-4df0-8174-49fdfd75bff5","resolution":{"observed_at":"2026-05-12T01:46:13.959879Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gemini models: Gemini 2.5 pro","venue":null,"work_id":"e35da65f-3288-4bd0-b7ca-36780d794ed1","year":null},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:6e764d8f18b4062d893392ea0b5e3dfc48a9468f14f55795a869775bac318583","observation_id":"ba6fc461-36a2-49dd-9d33-13637a3d96ff","resolution":{"observed_at":"2026-05-14T06:08:25.020696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2, 4, 6, 7, 8, 12, 17, 18, 19","venue":null,"work_id":"6c58a459-b8e4-432a-8aee-a8b13c8f8371","year":2025},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:cfe86966a01ea359bbcbd6246454d72c1f1dc7354f324176b8b5f1ae5fc94a94","observation_id":"aaf8f905-9c22-4d1f-8a28-cf0f8565531f","resolution":{"observed_at":"2026-05-14T06:08:25.043630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rout- ledge","venue":null,"work_id":"807df161-684a-42a9-a24f-8e1c4290b99e","year":2018},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:d53ca3383d927c7bb3d8fe07da84fa83f078cba6d9b09cdbedff69b9aa447dd9","observation_id":"2e1f3bec-4f6d-4347-98b7-d978410731ea","resolution":{"observed_at":"2026-05-14T06:08:25.041203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":"2405.21075","doi":"10.1609/icwsm.v17i1.22209","metadata_source":"pith","pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","venue":"cs.CV","work_id":"77fd5ac9-ae98-4846-9d83-e9c73c8f2a52","year":2024},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:63e7cb86993dc9623a01fdadef80798cfeb9f23042cfc52bd967d83e9a91d15c","observation_id":"56898397-9ff3-4fbc-8501-74f686ab5c1a","resolution":{"observed_at":"2026-05-12T01:46:13.969368Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":"2501.01957","doi":"10.48550/arxiv.2501.01957","metadata_source":"pith","pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","venue":"cs.CV","work_id":"510354f3-222a-48da-bda9-96a2df30bb68","year":2025},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:fd614bfe14593fff06fe9819f0aeb19625efeeb3d24f522bd222ade9ed6f7c98","observation_id":"ddcbbf63-5dd0-4327-a7c6-54e35000ab50","resolution":{"observed_at":"2026-05-17T21:08:19.955297Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:46.657095+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:46.657095+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16048","last_updated":"2025-02-25T06:46:02Z","snapshot_observed_at":"2026-08-04T19:26:38.729409Z","submitted_at":"2024-03-24T07:29:04Z","title":"Edit3K: Universal Representation Learning for Video Editing Components","version":2},"cited_work":{"arxiv_id":"2403.16048","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.16048","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Edit3k: Universal representa- tion learning for video editing components","venue":null,"work_id":"220ac1d5-72b5-4f2c-9ff5-bcb6bbbe3d44","year":2024},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"cited_paper":"/paper/2403.16048","citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:932eec0488bd7c69cffd80423e5f15557a7673de9402192dd3b98853fb308365","observation_id":"1eef172e-fe64-428e-8567-954c569f4741","resolution":{"observed_at":"2026-05-12T01:46:14.009776Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":"d796eccf-43d3-4315-af23-09d640acb6ad","year":2015},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:a6045076af0bad57ca175948698c1cbd1e3470f82b19c76e63f9399236db1e2b","observation_id":"2080c02b-a044-42fb-ae7b-427c50401297","resolution":{"observed_at":"2026-05-14T06:08:25.003915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"cited_work":{"arxiv_id":"2501.13826","doi":"10.48550/arxiv.2501.13826","metadata_source":"pith","pith_arxiv_id":"2501.13826","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","venue":"cs.CV","work_id":"365a8624-64bf-45a7-8a3e-c575aba224dc","year":2025},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"cited_paper":"/paper/2501.13826","citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:77599bc6d02c8ba8105b8704ae84bfdfdc7f0d76eeee5b0d515b0dc52697836d","observation_id":"ecd96d5f-e3e1-4aee-a47e-1c5169d31208","resolution":{"observed_at":"2026-05-14T00:32:41.480822Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"B-script: Transcript-based b- roll video editing with recommendations","venue":null,"work_id":"3441f659-da70-4bf7-8823-f92208b5c92b","year":2019},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:e6182e9a91e462e3f9700ea80a5b992b1a7782ca292502a05224686c6192b478","observation_id":"17c7c706-eea0-4983-9498-7d7dbfba9c59","resolution":{"observed_at":"2026-05-14T06:08:24.995907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Routledge","venue":null,"work_id":"d77cc77d-f011-4ef0-960f-bce994fc6f87","year":2016},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:188366c8c1eb28a4789095baeda1caef41412d2d0df61166f09e4cab49c2d9f2","observation_id":"a0735e0e-082a-4940-b3d7-7480a72c8923","resolution":{"observed_at":"2026-05-14T06:08:25.032927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-07-06T05:43:22.028213Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":"1705.06950","doi":null,"metadata_source":"pith","pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-07-09T11:16:11.423695Z","title":"The Kinetics Human Action Video Dataset","venue":"cs.CV","work_id":"c8a3de61-cfd3-4aeb-bcf7-a0372c015748","year":2017},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:7d5efbc95906ef6c17627944a9fc25204e5421460daa9777e7e3dae96464b716","observation_id":"1279e9d8-e6c8-4d53-b329-a2fcc9510f0c","resolution":{"observed_at":"2026-05-12T01:46:14.006405Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Veu-bench: Towards comprehensive under- standing of video editing","venue":null,"work_id":"04051c58-ffed-4945-882a-574dd8446b81","year":2025},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:34f47ecfd5e3ba6233d04792597785335a24e408451121238919ab2ea84a5be4","observation_id":"52f57a4c-073a-46a2-8636-465ae3e7ae87","resolution":{"observed_at":"2026-05-14T06:08:25.026642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.10689","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:49:57.259029Z","title":"Omnivideobench: Towards audio-visual understanding evaluation for omni mllms","venue":null,"work_id":"0ebfaa5e-4689-4250-a835-aee0b4ce9a33","year":2025},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:c60268a505f7bb812430a7e7769f5fe36fc217132983901613348628341d6ec5","observation_id":"d971314e-1153-44c3-9631-166148f9a111","resolution":{"observed_at":"2026-05-12T01:46:13.993497Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.07895","doi":"10.48550/arxiv.2407.07895","metadata_source":"pith","pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","venue":"cs.CV","work_id":"746ec475-051a-45ef-a6ed-2de8118466e4","year":2024},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:e3724ab9114d539aedf7c3ebf157e8a496e0ee7e8884139f55715c6f427cefcf","observation_id":"c05576d7-0c16-485c-820f-9b631f10e9f6","resolution":{"observed_at":"2026-05-12T01:46:13.996824Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From representa- tion to reasoning: Towards both evidence and commonsense reasoning for video question-answering","venue":null,"work_id":"a65ebb4a-adf8-4181-8b32-2f969bfab850","year":2022},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:1b13fa0602bfd14017f841f33e92f7a26b0be726d34064e36800944629d4289b","observation_id":"a8c54e84-a4df-4cca-897c-47b0584dc843","resolution":{"observed_at":"2026-05-14T06:08:25.029893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:54:34.134592Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916","venue":null,"work_id":"ab7d08b3-b549-45f3-94a0-7c16607d7e53","year":2023},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:4e53a521db49fd2717fcf61002b4a51b84b99d1cf4c91615cdc6aa6b6c4a991e","observation_id":"7288ce7f-15ce-4d77-8d38-0c9ba640ea99","resolution":{"observed_at":"2026-05-14T06:08:25.074995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.21356","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:40:00.924244Z","title":"Shotbench: Expert-level cinematic understanding in vision-language models","venue":null,"work_id":"b272857b-e5ad-4a8d-9e2c-ead8905cf793","year":2025},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:31ff6a3b253750e1607579abb2be7e88d3f20ed309854ae367f4651c322f4a8a","observation_id":"e2f2234b-8652-4a36-b7e1-3feb5e406316","resolution":{"observed_at":"2026-05-12T01:46:13.982301Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":"8d5af659-c683-4acf-a34a-1d0a54ec4152","year":2024},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:08e115f5251b8d6148c93345331ebe2c63c36d74ce72c5fad91eaf0a36c2e007","observation_id":"54dfbac0-7998-4141-9c1f-9cebbd314ab0","resolution":{"observed_at":"2026-05-14T06:08:25.035988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"University of Chicago Press","venue":null,"work_id":"bb593aef-4b72-4486-867b-6025807c2d2b","year":1991},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:0f0e310c58be39a14bba097c613b79ae11ea98d76c368112a91b9f4cbbd1f252","observation_id":"3559ed95-7c5e-44b8-bd63-e7504db47c62","resolution":{"observed_at":"2026-05-14T06:08:25.038646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-4o: Openai’s newest multimodal model","venue":null,"work_id":"47d21e20-308a-4d39-8d8c-d3029c70e039","year":2024},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:76f897faa38801354c8282d0a3bfa0e5d481bb75091f083922679a935824cc97","observation_id":"32806bd2-610e-4563-ab90-eccaea93760b","resolution":{"observed_at":"2026-05-14T06:08:25.017286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perazzi, J","venue":null,"work_id":"0bc265c0-0b82-4450-b564-9c0c45bb4486","year":2016},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:f3504600e35ffca4f988c07d3531b7fa31089f3f1613e3ddc5ed4dac69ade650","observation_id":"1a1d5f99-c8eb-4af1-b18c-a8005a997050","resolution":{"observed_at":"2026-05-14T06:08:25.023636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07956","last_updated":"2025-04-10T17:59:03Z","snapshot_observed_at":"2026-07-06T21:07:29.062389Z","submitted_at":"2025-04-10T17:59:03Z","title":"VCR-Bench: A Comprehensive Evaluation Framework for Video Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":"2504.07956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.07956","snapshot_observed_at":"2026-07-04T05:49:36.609405Z","title":"Vcr-bench: A comprehensive evaluation framework for video chain-of-thought reasoning","venue":null,"work_id":"bc64fca8-39fc-44be-bafa-6fefc7c0275b","year":2025},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"cited_paper":"/paper/2504.07956","citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:8100b17bf5543541d1d1e42e3abb3bf49038ed96df9ee46fbf695a57eb822a12","observation_id":"eb9960d6-39dc-45a2-9a1d-54c5718145b7","resolution":{"observed_at":"2026-05-12T01:46:13.974098Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen3-vl.https : / / github","venue":null,"work_id":"475552cd-b97c-4ba1-98a1-1c5d9b7ef44c","year":2025},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:dcd6044dda9224269180f44da90adda141a550b9a316e147d1f0e867ee69b7b3","observation_id":"9f6ddd63-1eef-4b50-ad80-bc0c7dc857cb","resolution":{"observed_at":"2026-05-14T06:08:24.987974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sage Publica- tions","venue":null,"work_id":"a2e5bbee-910e-4ae1-b795-cc31d7de87f3","year":2007},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:b7b2ed064baa8a0dcefe03a1532b577efe17cfab490ca56b1b4a8d4151fdb114","observation_id":"19345d41-4596-4226-96ae-3d7696e51159","resolution":{"observed_at":"2026-05-14T06:08:25.055466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-mmlu: A massive multi- discipline lecture understanding benchmark","venue":null,"work_id":"23a4df5f-df4f-499c-ad09-312ef7c0493a","year":2025},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:b06c17ec9794283f9b93631460bb7666fdc8d4c26753712784dc296053640aaa","observation_id":"e8833042-c6e1-44b2-a39e-8742d9f4b0c8","resolution":{"observed_at":"2026-05-14T06:08:25.062041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":"1212.0402","doi":"10.48550/arxiv.1212.0402","metadata_source":"pith","pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","venue":"cs.CV","work_id":"5dfb46e7-e952-409d-a3c7-ba7f20aebad6","year":2012},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:e4a5f23b29b8fbdd33baf7b7d60e161bfc8833aaa7046966c14e813834cb783c","observation_id":"39a509f4-61e7-4cc0-b868-bfae9ddd69a0","resolution":{"observed_at":"2026-05-12T01:46:13.964294Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen3 technical report","venue":null,"work_id":"7a1d9b9a-f71c-49e4-853a-218fdc87628f","year":2025},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:fb387be874ee3c2e466b956734176479e7d9d567b07221309df7e7458851a4ee","observation_id":"3cb3f822-1bb4-48fa-99e6-ac825bf317a5","resolution":{"observed_at":"2026-05-14T06:08:25.058853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Research on the application of nonlinear edit- ing technology in vlog production","venue":null,"work_id":"78156337-78f2-41fb-98be-4220a1de21b3","year":2021},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:12a57723eef92ef151f108872cda9281a339245253131e48c40963df8bdaa18d","observation_id":"ee453567-c7e2-470a-b981-c97471120e93","resolution":{"observed_at":"2026-05-14T06:08:25.068441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15145","last_updated":"2025-05-21T06:02:39Z","snapshot_observed_at":"2026-07-06T21:27:37.409259Z","submitted_at":"2025-05-21T06:02:39Z","title":"CineTechBench: A Benchmark for Cinematographic Technique Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2505.15145","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15145","snapshot_observed_at":"2026-07-04T17:40:00.908480Z","title":"Cinetechbench: A benchmark for cine- matographic technique understanding and generation","venue":null,"work_id":"87f2cf3e-085c-4220-860d-db3212995522","year":2025},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"cited_paper":"/paper/2505.15145","citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:8f07065786e876cd5c9018f3239f9b1d0aa7138ae239556e9a166d9020a2d217","observation_id":"3df129eb-f5ae-4e41-afde-f1e7fb8bc5d7","resolution":{"observed_at":"2026-05-12T01:46:13.978283Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Longvideobench: A benchmark for long-context interleaved video-language understanding","venue":null,"work_id":"225fb8ea-0f1e-4328-a1af-eb85b36d0b98","year":2024},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:fe55913ac106923b7b9f53eb74e84b7038d1ba9b4f1caad42f90d7779787c6a2","observation_id":"e7890ddb-aaee-42f8-8a92-00b72e438295","resolution":{"observed_at":"2026-05-14T06:08:25.046624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond raw videos: Understanding edited videos with large multimodal model","venue":null,"work_id":"ef1d3cf8-0196-4c6f-958f-d830d1098372","year":2025},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:8685dfad2db5335d23fc7fad45754a5476107e8e41b7a746ee669a0a3aaa75b7","observation_id":"323eaa52-a13e-4814-a781-90ad3a54291c","resolution":{"observed_at":"2026-05-14T06:08:25.071461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.03327","last_updated":"2018-09-06T04:19:45Z","snapshot_observed_at":"2026-07-06T07:00:12.122241Z","submitted_at":"2018-09-06T04:19:45Z","title":"YouTube-VOS: A Large-Scale Video Object Segmentation Benchmark","version":1},"cited_work":{"arxiv_id":"1809.03327","doi":null,"metadata_source":"pith","pith_arxiv_id":"1809.03327","snapshot_observed_at":"2026-07-08T02:04:26.310872Z","title":"YouTube-VOS: A Large-Scale Video Object Segmentation Benchmark","venue":"cs.CV","work_id":"2798c43d-6f6c-445b-8a43-14cba092aa4b","year":2018},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"cited_paper":"/paper/1809.03327","citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:fb564a01e579422f2cefc762f98820592a6f5967d48126228ba885dc6c08a6e6","observation_id":"19766d70-a65c-4db4-90d9-718cd387a5f0","resolution":{"observed_at":"2026-05-12T01:46:13.949720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:d29243f667736d32f26eac2cb29f24905b0b1debae0348b4933414ac53f6e65b","observation_id":"1ed5d487-9e1b-4e07-a2fc-e37cd6298617","resolution":{"observed_at":"2026-05-12T01:46:13.985857Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":"2501.13106","doi":"10.48550/arxiv.2501.13106","metadata_source":"pith","pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","venue":"cs.CV","work_id":"38f52461-37fd-4266-bc46-9dea31be2824","year":2025},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:549a51dce2d1e30c93f6b62fa229f257d71cf47cae63bd6a41baee100d137f6e","observation_id":"d890b3e6-1d6d-45fe-b98f-6abcdd6cfe48","resolution":{"observed_at":"2026-05-12T01:46:13.989379Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-07-06T18:36:12.298104Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:d936bf15579dec2f0d43790689d7f53ef60d5d57dc5d3025aac37e745179b80d","observation_id":"42e9010d-71af-4681-9788-50b528eb2db4","resolution":{"observed_at":"2026-05-12T07:08:36.726593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards automatic learning of procedures from web instructional videos","venue":null,"work_id":"c94f0a4a-4212-4003-b33c-d51eefc11986","year":2018},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:47941aa6605d6feffd30744417ed4d9d10f2ea95b4f5d476db420eeb5a81890c","observation_id":"3014223d-0f95-496e-8e00-a295897c150a","resolution":{"observed_at":"2026-05-14T06:08:25.013671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"When does the{CUT TYPE}occur in the video?","venue":null,"work_id":"e7a7c58b-940c-4923-952a-6db9e6e0ed56","year":2025},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:87dd54a3aa548727b7ec09a55dc2ab44caf46e6ac9bac3538760878ddda633ef","observation_id":"c6394ad0-b7b2-4769-bb38-c383566883f1","resolution":{"observed_at":"2026-05-14T06:08:24.999781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"high\", \"medium","venue":null,"work_id":"79642678-68e7-4d5d-a1cf-c581612f27de","year":null},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:3f518fe6a1efc1d21d680709ac431722d40820c476ba7e1584b7157be9f15256","observation_id":"44a6e817-0593-4731-ad88-62052e2024d2","resolution":{"observed_at":"2026-05-14T06:08:25.049100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yes\"/\"No","venue":null,"work_id":"ededd22a-219f-4327-9bdc-b7b3788924de","year":null},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:011472129cccb0a1d48f8ada2af23d257285fdf974b756953dd35b474d504840","observation_id":"d5b16fa2-6ad3-4e0f-8ac8-67c724b9861b","resolution":{"observed_at":"2026-05-14T06:08:25.064993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ad301a41-4cb0-4150-9c43-64db36f9c175","year":null},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:369eda2adf256da3a835395f6063784a1be27d1aa26841ec379804e655576191","observation_id":"331a5521-99df-4ee9-be25-1d0b1ec7116e","resolution":{"observed_at":"2026-05-14T06:08:24.992143Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"timestamp_start","venue":null,"work_id":"2ddcf7fd-a197-44b0-b096-99f5c9e98ea2","year":1978},"citing_paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:34.898639Z"},"links":{"citing_paper":"/paper/2605.03276"},"observation_digest":"sha256:cade3b39e0d64a35c657d136e832b6cbea6ef74a9d8aa63701f3b5de0407bd47","observation_id":"7df02a14-7bf2-48c1-aba5-0d5f5b8af252","resolution":{"observed_at":"2026-05-14T06:08:25.051897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.03276","last_updated":"2026-05-08T23:14:34Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T06:50:49.392802Z","submitted_at":"2026-05-05T02:05:27Z","title":"VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":19,"verified_fuzzy":27},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2605.03276."}