{"as_of":"2026-08-09T05:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4c094e7ddf49f326dd8038f91e32c1e17d7704290332a6146280fb820229ae51","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T02:57:35.417802Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.25300/citation-record","integrity":"/paper/2607.25300/integrity","json":"/paper/2607.25300/citation-record.json","paper":"/paper/2607.25300"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.526010Z","title":"Adopting self- supervised learning into unsupervised video summarization through restorative score","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.526010Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:c51a3dd0da7c7b1862d6c495e316c947c89a4a30dc8e2816e84986744c7bd24b","observation_id":"ecced3ec-8956-43b8-8873-8915804c5eca","resolution":{"observed_at":"2026-08-01T02:57:33.526010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.531817Z","title":"Combining global and local attention with positional encoding for video summarization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.531817Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:b465c0332aa13d1a0040c981c0ab4041c944c1c918245e771fad53b8e50311b2","observation_id":"acda662c-6162-4503-9b3c-fd3458d436e4","resolution":{"observed_at":"2026-08-01T02:57:33.531817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.537215Z","title":"Summarizing videos using con- centrated attention and considering the uniqueness and diver- sity of the video frames","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.537215Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:5856d0390b7beb7a814e70b51563a9f8b0fe439b14fc3b2c44d4ca527b0afe82","observation_id":"27d5d21a-0523-4123-a40c-ae1ba4b9053d","resolution":{"observed_at":"2026-08-01T02:57:33.537215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.542503Z","title":"Scaling up video summarization pretraining with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.542503Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:f0021a4d86df95ee89f31699fe122dfc7c716059e676cd4c3179d4887b58b3f4","observation_id":"59baaf17-8b2b-4b27-b110-c428ee0f6d7c","resolution":{"observed_at":"2026-08-01T02:57:33.542503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-01T02:57:33.547372Z","title":"Qwen3-VL technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.547372Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:6f9718e8191640555df0a81f487a0289c3a4f2e9250b2433d906698bd28a5f13","observation_id":"1de320e2-cd3a-4139-94e1-2109e9b99123","resolution":{"observed_at":"2026-08-01T02:57:33.547372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.553920Z","title":"Blender studio films.https://studio","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.553920Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:31073bb84226b7ff1187ffe56ca56b4de1808a6fcdfff1cbd4fcd4cbfc49ecb4","observation_id":"ff241b79-9bbc-432b-ad24-16efc41ab4d6","resolution":{"observed_at":"2026-08-01T02:57:33.553920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.559812Z","title":"VSUMM: A mechanism designed to produce static video summaries and a novel evaluation method.Pattern Recog- nit","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.559812Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:b1b7c0930fc0b9e866bb746f95ac2ebda84532ef4ebbf30025add1adc69601e5","observation_id":"093d8ffd-64fb-4612-9cf7-98c1eedbb5ec","resolution":{"observed_at":"2026-08-01T02:57:33.559812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.566410Z","title":"Summarizing videos with attention","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.566410Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:ea14dbccdf48c1450abd4f33d5c623311ca2060e97c703c511396f7481b95894","observation_id":"87394ed8-fd48-4735-977e-5a16af907239","resolution":{"observed_at":"2026-08-01T02:57:33.566410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.573564Z","title":"Video-R1: Reinforcing video reasoning in MLLMs.NeurIPS, 38:99114–99137,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.573564Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:6cb93a2b26ef07a7dfd986c408483abaf87592e51a6c7b7bbc5f59b3610b856f","observation_id":"f517d32b-6f65-4f09-81b4-b8854a870cae","resolution":{"observed_at":"2026-08-01T02:57:33.573564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.577949Z","title":"Au- tomatic non-linear video editing transfer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.577949Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:4035c8f6a04c03f4726af4d33ccede2e7de6f556c058974a3763f817f3ac19e3","observation_id":"1526b89c-f3bf-481d-a0f6-4b3f32a69e5b","resolution":{"observed_at":"2026-08-01T02:57:33.577949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.581992Z","title":"Video-MME: The first-ever comprehensive evaluation benchmark of multi- modal LLMs in video analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.581992Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:d8715190a52755cec5c1f6f494226dbd659d701de8de9fb7b3207ea93959618d","observation_id":"4612b575-b863-4be5-8268-5df9bfe7066b","resolution":{"observed_at":"2026-08-01T02:57:33.581992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.586663Z","title":"Training-free language-guided video summarization via multi-grained saliency scoring","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.586663Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:3770521efb799c68162f479540ffc37cab8f371705a20ebd413171c9f61d639a","observation_id":"1049e734-6252-40a7-b747-b7c66e8b30f5","resolution":{"observed_at":"2026-08-01T02:57:33.586663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.591243Z","title":"Supervised video summarization via multiple feature sets with parallel attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.591243Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:6133540aec0635c7a14590c3cf6cbc9232c7b7ed635f57fcb65ce4a495dc80d4","observation_id":"9aa6d92c-f5ab-46ce-84bf-d1d51241a196","resolution":{"observed_at":"2026-08-01T02:57:33.591243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-01T02:57:33.595868Z","title":"A survey on LLM-as-a- judge.arXiv preprint arXiv:2411.15594, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.595868Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:d7983cf9418aed1b9a311dc4989215b612248efca77b137c6d901471509a11cc","observation_id":"5a58f19a-82d1-447d-a574-17ed5d27a40b","resolution":{"observed_at":"2026-08-01T02:57:33.595868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.600907Z","title":"VTG-LLM: Integrating timestamp knowledge into video LLMs for enhanced video temporal grounding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.600907Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:7ac0865c5f532285602ffa2ae1f7d1d68f6ae2433007fe72521ebb68e5440b43","observation_id":"c728aa61-d9b1-4197-b6a2-5da281883f28","resolution":{"observed_at":"2026-08-01T02:57:33.600907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.606418Z","title":"Creating summaries from user videos","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.606418Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:93e83d5f3f7803e11c16b27726a6ea697771d33e80224f890aecab8584bea70f","observation_id":"3ca9901d-096e-4061-ab4c-97a148843892","resolution":{"observed_at":"2026-08-01T02:57:33.606418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.611332Z","title":"Align and attend: Multimodal summarization with dual contrastive losses","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.611332Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:68bae1f7445bb112c45e31b4537137a5d53d19490df0ab32beec724969c60f9a","observation_id":"a7d90a2c-4405-41d9-aae1-0bf39a09d96b","resolution":{"observed_at":"2026-08-01T02:57:33.611332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.617191Z","title":"MovieNet: A holistic dataset for movie under- standing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.617191Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:cf5c7204d042d593f2e3b276ccb106e5c6d61f686c0768163d00dad8f090be75","observation_id":"acfa2fc3-39d0-46a4-9ed5-1b8035c2a4de","resolution":{"observed_at":"2026-08-01T02:57:33.617191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.623434Z","title":"Joint video summarization and moment localization by cross-task sample transfer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.623434Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:d6c851bb32849982665206d163a26875593557335961ef3bc98f8dc87987b97c","observation_id":"6fd57df8-6057-4080-ac17-65e9d06b8542","resolution":{"observed_at":"2026-08-01T02:57:33.623434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.633320Z","title":"Discriminative feature learning for unsu- pervised video summarization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.633320Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:5bdf2ab6b3563d6611108ebd02c92b39c913dab27b2795cc51be060f65711038","observation_id":"a192e377-fd68-4f53-8236-3dcd1e8de382","resolution":{"observed_at":"2026-08-01T02:57:33.633320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.646692Z","title":"Dense-captioning events in videos","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.646692Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:5dd841f7e9a459a5a8bdb95b114b60d144f80b05b3a5e6435fc5e5e3301e4511","observation_id":"e914b6eb-0492-4220-8877-28d176408329","resolution":{"observed_at":"2026-08-01T02:57:33.646692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.659453Z","title":"Computational video editing for dialogue-driven scenes.ACM Trans","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.659453Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:8a9610f721702bbe64e22a3cf92ef8bd8c234d08b2259888e2014dabd4b24fb3","observation_id":"2da01de5-bbbf-4d77-8beb-e4ccfb1c4176","resolution":{"observed_at":"2026-08-01T02:57:33.659453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.680677Z","title":"Video sum- marization with large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.680677Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:6fc684301f62cd953e5a3b60e7a5976a12343fc0418cc594d7fda359125f56e2","observation_id":"f3f5c708-8ebf-4238-8d97-484837367b00","resolution":{"observed_at":"2026-08-01T02:57:33.680677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.700419Z","title":"Detecting mo- ments and highlights in videos via natural language queries","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.700419Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:7fc5e7ff99e707c9e3be1d5f80b3064b11bf3a279e7ff0af610d13db8f311136","observation_id":"86900be1-3d86-456f-a173-501ca56e32a4","resolution":{"observed_at":"2026-08-01T02:57:33.700419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.721473Z","title":"Progressive video summarization via multimodal self- supervised learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.721473Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:a127ef1c4a33ada903bf289637e53775cc0f89ff22b63975f86d68469302b7eb","observation_id":"b63513ae-f924-4abf-ad7b-743101a434e0","resolution":{"observed_at":"2026-08-01T02:57:33.721473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.747254Z","title":"Progressive video summarization via multimodal self- supervised learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.747254Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:5d0c4c78999ad2078a3949bc53a62d66545fa01f873a83e86660a8aafa352b47","observation_id":"062e7a7a-18d2-4467-adf9-01a0a304ad21","resolution":{"observed_at":"2026-08-01T02:57:33.747254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.771469Z","title":"VideoChat-R1: Enhancing spatio-temporal percep- tion via reinforcement fine-tuning.NeurIPS, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.771469Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:3170e130a4c59dd330611667fbb1870cb5919831dc7c1b61db173366ae8beb61","observation_id":"da640c86-dd3c-4611-b5c5-b1c815b40c3a","resolution":{"observed_at":"2026-08-01T02:57:33.771469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.793614Z","title":"VideoXum: cross- modal visual and textural summarization of videos.IEEE Trans","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.793614Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:ce08900dec5c84f1cb7c23c7c389093ebf8eb9407eb691b50e28edcc46fa5b7e","observation_id":"41c3e89d-2252-4411-b6d1-10fcd170bf27","resolution":{"observed_at":"2026-08-01T02:57:33.793614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.819796Z","title":"Visual instruction tuning.NeurIPS, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.819796Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:90ab95bdcfdba8f1d405511f0ff8d593bcd50956b83ae897ffa53ae749ab067e","observation_id":"b70bf6a0-9822-46b6-8405-91157efb81a6","resolution":{"observed_at":"2026-08-01T02:57:33.819796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.841722Z","title":"G-Eval: NLG evaluation using gpt-4 with better human alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.841722Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:01831699915e3892de3072451d21a70bf938edc9d350de4d05c3c25b0632d096","observation_id":"4fcf045e-d7f8-4251-8ddc-1a187e0b7952","resolution":{"observed_at":"2026-08-01T02:57:33.841722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:33.910460Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:33.910460Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:3f5426e8daf044d2a33a6a63a854788164ebb1565a90e5fcb8a85f1c011311c1","observation_id":"49c0c03c-75b9-41ff-81c8-1c126a6ae26b","resolution":{"observed_at":"2026-08-01T02:57:33.910460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:34.008992Z","title":"Chrono: A simple blueprint for representing time in MLLMs.arXiv preprint arXiv:2406.18113, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:34.008992Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:71b020fc70fbf725330f248e800d35763f98a79d20ca0ab0a8ae221e5f55575b","observation_id":"1ebf3e82-6a7c-431d-8d72-8db30a0f133b","resolution":{"observed_at":"2026-08-01T02:57:34.008992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:34.127674Z","title":"CLIP-It! language-guided video summarization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:34.127674Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:2d97a0865f0f273ff619e43547b38f9738f8e773afa03b760c1e5733a405a307","observation_id":"ec5547e9-99dc-4c2c-b7f1-3d9f24c42fdf","resolution":{"observed_at":"2026-08-01T02:57:34.127674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:34.285272Z","title":"Rethinking the evaluation of video summaries","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:34.285272Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:db542d705c19f69739f1527653b7f63ba730b348d624cb1bf9b20c6b66ca87f1","observation_id":"b48724bc-2013-4ce5-afd3-1dd42a55a6ee","resolution":{"observed_at":"2026-08-01T02:57:34.285272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:34.407233Z","title":"Contrastive losses are natural criteria for unsu- pervised video summarization","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:34.407233Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:689374f32283c1e072182014224096f2909aeea2e88ab9cb0d838dd410dc6354","observation_id":"f334b4cd-eb25-4f6f-bb75-206a797ed8ca","resolution":{"observed_at":"2026-08-01T02:57:34.407233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:34.538157Z","title":"Mea- sure Twice, Cut Once: A semantic-oriented approach to video temporal localization with video LLMs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:34.538157Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:ce4e7f4e96ac39994475e7cb473fc48f48fede0a8eb2b044e9e46dfef7124f9a","observation_id":"6b51240d-382e-4790-b7b0-646b837f855a","resolution":{"observed_at":"2026-08-01T02:57:34.538157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:34.652076Z","title":"MovieCuts: A new dataset and benchmark for cut type recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:34.652076Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:2307bf1aaab52519c1ac30d0c6205f4d4d9c81e355f9c9760d5619917bebb317","observation_id":"d5debe9c-38ca-407e-bc5a-c918a90f6f4f","resolution":{"observed_at":"2026-08-01T02:57:34.652076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:34.724308Z","title":"Generative timelines for instructed visual assembly","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:34.724308Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:51ff0d2f28d84dfb5533c621f9258ef3045ecce915c9b50b5c29529bf4165d69","observation_id":"5922fd12-7f72-49b0-ae3d-b7d02d6b5cc7","resolution":{"observed_at":"2026-08-01T02:57:34.724308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:34.884059Z","title":"MMSum: A dataset for multimodal summarization and thumbnail gen- eration of videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:34.884059Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:79483460f0a7d7daf327ae9d2a5d1e2cfa4ffe3454b268026ec5070336b24b65","observation_id":"340a0024-cb23-46fc-ad60-2e35af0d907e","resolution":{"observed_at":"2026-08-01T02:57:34.884059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:34.950203Z","title":"TimeChat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:34.950203Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:b2d44eb5bb86997057b96fb2e96ffdd8f564a1ebed80172e91b7160177966ada","observation_id":"0449790b-45b0-41e3-9677-b1c772a3243a","resolution":{"observed_at":"2026-08-01T02:57:34.950203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.052912Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.052912Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:175c9623353b6918390726a452d602941ebd32da5d06e182bd5a1d0fe91c0044","observation_id":"41add252-88da-4500-82b0-0b2e80965a3d","resolution":{"observed_at":"2026-08-01T02:57:35.052912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.119099Z","title":"Judging the judges: A system- atic study of position bias in LLM-as-a-Judge","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.119099Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:dbf13f1096344c57c89ecb76b95b37a044b7a387ba3cb4089a4da23b737b83b7","observation_id":"71a2a1fc-0ad2-49c5-b9d6-3f60a8bfdb18","resolution":{"observed_at":"2026-08-01T02:57:35.119099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.224975Z","title":"Generic event boundary de- tection: A benchmark for event segmentation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.224975Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:a6a0e57307c14c2cb6aed330fd526cedcbc6e50c52d89a1039b17a27c203a92a","observation_id":"05e84f1d-c50e-42e2-abff-77a382ff51e9","resolution":{"observed_at":"2026-08-01T02:57:35.224975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.325730Z","title":"CSTA: Cnn- based spatiotemporal attention for video summarization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.325730Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:1506c75c20084c0485488bf9fd36a72d274402de341afa8d2e4c9f2036042381","observation_id":"129aa3b8-ae6f-44d0-b473-8fe1787e0a99","resolution":{"observed_at":"2026-08-01T02:57:35.325730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.330070Z","title":"Csta: Cnn- based spatiotemporal attention for video summarization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.330070Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:e90f2b253a6ddcfc9342db1227acf7dfde72e8c34c28d3876f2eee9a726e9599","observation_id":"79796f32-ba54-46e4-9a8b-1e47c22205b8","resolution":{"observed_at":"2026-08-01T02:57:35.330070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.334102Z","title":"TVSum: Summarizing web videos using titles","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.334102Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:7c95fdb2a3b5b0c0fc416241a92b436d3e6352a9e8b31f364b375027f38cb6cf","observation_id":"e7cc1cd1-8c6a-4491-aa08-5d0f4bdeeb89","resolution":{"observed_at":"2026-08-01T02:57:35.334102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.338185Z","title":"Language-guided self-supervised video summarization using text semantic matching considering the diversity of the video","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.338185Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:e9824f2be310d59de6e46ad4d57d07379f32d8630258505e553d50e2bb9db5c1","observation_id":"4094f2cd-4abe-4731-b9d8-8afde550e466","resolution":{"observed_at":"2026-08-01T02:57:35.338185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.342337Z","title":"Gemini: A family of highly capable multimodal models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.342337Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:bda67a05fd1368409a2c2f590c5d91db9e96aef8ebe0d57c7caf175fb9ccbde7","observation_id":"04c50e48-d688-4b89-b878-b6073eca71b3","resolution":{"observed_at":"2026-08-01T02:57:35.342337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.347096Z","title":"QuickCut: An interactive tool for editing narrated video","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.347096Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:1d1ec52212c894e50cdc599e205c5020e5848465ecfab50135de39890886f64d","observation_id":"9aeab3b7-f291-467e-9636-b198e9faf1b7","resolution":{"observed_at":"2026-08-01T02:57:35.347096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.351267Z","title":"Query Twice: Dual mixture attention meta learning for video summarization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.351267Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:0039158d043843a5bf4d1f0df50fc88eec7461cc5ac9996b9ae9b9d1dd3d1b40","observation_id":"91f8cce7-7d4a-472f-a3f5-f575e5e5fff6","resolution":{"observed_at":"2026-08-01T02:57:35.351267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.356284Z","title":"Write-A-Video: Computational video montage from themed text.ACM Trans","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.356284Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:0daf7010a95c4d0728e29eb92af79d4069fa451744622cb454ff4ff25ac3368a","observation_id":"3fb8ca8c-cf18-4fcf-839d-204a33781b98","resolution":{"observed_at":"2026-08-01T02:57:35.356284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-01T02:57:35.360849Z","title":"InternVL3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.360849Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:3b44023d3767f9921c2f0c9969e1a21da52728400545df62528fd99f3c2899a0","observation_id":"c2aa9254-6cd7-4399-80e8-efc9746a1a6f","resolution":{"observed_at":"2026-08-01T02:57:35.360849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.364941Z","title":"Time-R1: Post-training large vision language model for temporal video grounding.NeurIPS, 38:83330– 83364, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.364941Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:1d5274a32d483ead1e1c7eb5675906675b41f0ca862f4e6984a66715a0d8bb74","observation_id":"a1397759-3ae4-4575-a7bc-fe20cf4c8182","resolution":{"observed_at":"2026-08-01T02:57:35.364941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.368984Z","title":"LongVideoBench: a benchmark for long-context interleaved video-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.368984Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:525cc2807df6de859cb88dc83eb793492619ae7d865f763acf4910098288992b","observation_id":"a07e9033-6de5-465c-8aff-cee5b8e24bde","resolution":{"observed_at":"2026-08-01T02:57:35.368984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.372928Z","title":"Transcript to Video: Efficient clip sequencing from texts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.372928Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:674d84f1225c1b6d31e19ca09701dd0795abaf7d030ea38f8efa31d6726948b6","observation_id":"2a774dfc-600c-434f-899c-2654861e571b","resolution":{"observed_at":"2026-08-01T02:57:35.372928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.376928Z","title":"Vid2seq: Large-scale pretraining of a vi- sual language model for dense video captioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.376928Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:badb114f158912b3721cc54b0bbc4d72dd8eddd88e9f9fe8083579adf1e3687b","observation_id":"000544e0-d069-4b55-a5de-b07b9c020bcb","resolution":{"observed_at":"2026-08-01T02:57:35.376928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.380934Z","title":"TimeLens: Rethinking video temporal grounding with multimodal LLMs","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.380934Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:0b20fd48d5e21b04b4bf04e1869ea07a29201125b52d7ce66c1419e24ec1e721","observation_id":"d2dd359e-a90e-45f9-bfb7-3443b4f3b7f7","resolution":{"observed_at":"2026-08-01T02:57:35.380934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01361","last_updated":"2023-11-02T16:11:09Z","snapshot_observed_at":"2026-08-02T05:59:18.612817Z","submitted_at":"2023-11-02T16:11:09Z","title":"GPT-4V(ision) as a Generalist Evaluator for Vision-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01361","snapshot_observed_at":"2026-08-01T02:57:35.385182Z","title":"Gpt-4v(ision) as a generalist evalu- ator for vision-language tasks.CoRR, abs/2311.01361, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.385182Z"},"links":{"cited_paper":"/paper/2311.01361","citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:09904fa649070ed67c0bfb228bea028227f3b667df6cb56a66719c36221a806d","observation_id":"355f80e7-92a6-489f-bca3-d1ee81bf4c9d","resolution":{"observed_at":"2026-08-01T02:57:35.385182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.389309Z","title":"Re- constructive sequence-graph network for video summariza- tion.IEEE Trans","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.389309Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:edf598c452f44758492cea9f63e25092e98e8807d7befd8701ea1500e17fb01d","observation_id":"6d41d762-6f0e-471f-bb80-5be68a0be5f8","resolution":{"observed_at":"2026-08-01T02:57:35.389309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.393918Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.393918Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:49cf25911b63f1f0e480a28d7fce0c1852c2afa89478c1cef985a9b6a31b4794","observation_id":"1c464df8-65b5-4080-a5f1-2c97c1e014db","resolution":{"observed_at":"2026-08-01T02:57:35.393918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.397619Z","title":"Deep semantic and attentive network for unsupervised video summarization.ACM Trans","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.397619Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:abf66a3a9dee3b14212d0dfdebda2d7a274be9bc8b92b4c5678f8d66e26c9561","observation_id":"38eaef64-af30-48cd-ab3a-81913c92698b","resolution":{"observed_at":"2026-08-01T02:57:35.397619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.401484Z","title":"MLVU: Benchmarking multi-task long video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.401484Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:a4619701f06ba6d14d97248838ef5f4b7babc86b948dfe252387df34b8a26e74","observation_id":"4d47acc8-b7f2-4d90-8e10-8ea365fe22cc","resolution":{"observed_at":"2026-08-01T02:57:35.401484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.405324Z","title":"Deep reinforce- ment learning for unsupervised video summarization with diversity-representativeness reward","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.405324Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:9bf74283b967fba65b2a077ad89182cd6de56e88832103881d39039faf048304","observation_id":"975ca5e2-7685-46d7-9015-5f25ee07038b","resolution":{"observed_at":"2026-08-01T02:57:35.405324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.408991Z","title":"Edits” counts edits with at least one temporal reversal; “Cuts","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.408991Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:dee60abf1ab4f19069117505b7a9f868e6ef055c9a2f15c334b38073a9feec31","observation_id":"a73ca798-edcd-4bac-baef-7dc7cf444de0","resolution":{"observed_at":"2026-08-01T02:57:35.408991Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.413753Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.413753Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:fd29685fc561fd489169dc08fa1eb78a2a94349d82a1aa2ded1f0dac5f8faba2","observation_id":"ec6c8238-0f87-4c20-b4c3-11eabcdd9401","resolution":{"observed_at":"2026-08-01T02:57:35.413753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:57:35.417802Z","title":"01:30:50","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T02:57:35.417802Z"},"links":{"citing_paper":"/paper/2607.25300"},"observation_digest":"sha256:41da62c8d73fb2db67666ab6c563e494746ad4be3183e80d08625e2800b32ad9","observation_id":"5f239f22-9ad7-4f3d-83af-9b65558bdbf3","resolution":{"observed_at":"2026-08-01T02:57:35.417802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.25300","last_updated":"2026-07-28T05:24:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-01T02:57:32.353255Z","submitted_at":"2026-07-28T05:24:10Z","title":"MEDit-Bench: A Dataset for Evaluating Message-Driven Narrative Video Editing"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":65,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2607.25300."}