{"as_of":"2026-08-17T05:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:46b61c17ba0a2afc0eb4875c6fd2ac4c2bca148788b3fe737337add2dd1e68d0","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:42:31.879391Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.07554/citation-record","integrity":"/paper/2501.07554/integrity","json":"/paper/2501.07554/citation-record.json","paper":"/paper/2501.07554"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:42:32.968550Z","title":"Detectron2 object detection & manipulating images using cartooniza- tion","venue":null,"work_id":"10279e1c-64d5-4eaf-abd7-25e208376e7c","year":2021},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.559158Z"},"links":{"citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:786939140b87b43826150b9d23fd3f44199fc18319922c793692aeba9abcd4c4","observation_id":"767c366f-a965-4f64-9df7-96d07d65ab07","resolution":{"observed_at":"2026-08-10T20:42:32.975975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:42:32.942245Z","title":"A deep learning framework for quality assessment and restoration in video endoscopy","venue":null,"work_id":"ee3d33de-b67a-4ec9-a61d-878cfd17a9ad","year":2021},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.570712Z"},"links":{"citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:917fda10e742f73e806bc8008db908fe45445c2f2a144372376faed42563f3d3","observation_id":"653c8f41-7a89-48b1-baa2-0b89e24d5a83","resolution":{"observed_at":"2026-08-10T20:42:32.955084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:42:32.914332Z","title":"Text2live: Text-driven layered image and video editing","venue":null,"work_id":"2e34c0e0-a911-40a8-823d-77ab915809bf","year":2022},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.578175Z"},"links":{"citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:e3b1f1c942cd46637f1625ecb892e1a2faf66c1815b504d0ce68d6b846c01324","observation_id":"942d282c-5328-4b35-a70c-365d22da9a9a","resolution":{"observed_at":"2026-08-10T20:42:32.928173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-10T20:42:31.590708Z","title":"Paligemma: A versatile 3b vlm for trans- fer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.590708Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:d2f0ea21ee410a80899b818e46df9c3c234ea1cedf85191dfffce3b38f7b4c74","observation_id":"3aabbcc7-f49a-4d2d-b84d-8476f907a3d5","resolution":{"observed_at":"2026-08-10T20:42:31.590708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19726","last_updated":"2024-05-30T06:16:33Z","snapshot_observed_at":"2026-08-16T13:47:54.888862Z","submitted_at":"2024-05-30T06:16:33Z","title":"Streaming Video Diffusion: Online Video Editing with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19726","snapshot_observed_at":"2026-08-10T20:42:31.599729Z","title":"Stream- ing video diffusion: Online video editing with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.599729Z"},"links":{"cited_paper":"/paper/2405.19726","citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:84381c1fc94a2a5a509100a62eaff700654e6c1910f01fe33c5c18becb67700d","observation_id":"128ee8d3-6fdb-4d6e-a6e0-f45f95cd55a7","resolution":{"observed_at":"2026-08-10T20:42:31.599729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13840","last_updated":"2024-08-12T08:30:05Z","snapshot_observed_at":"2026-08-16T15:30:44.303194Z","submitted_at":"2023-05-23T09:03:19Z","title":"Control-A-Video: Controllable Text-to-Video Diffusion Models with Motion Prior and Reward Feedback Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13840","snapshot_observed_at":"2026-08-10T20:42:31.609586Z","title":"Control-a-video: Controllable text-to-video generation with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.609586Z"},"links":{"cited_paper":"/paper/2305.13840","citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:ec2b650be6c9219d2a575fca866f1b7e2842afa8574cf9636df593cc779265f5","observation_id":"094c37a2-89ea-44f0-bf68-1918eebe2c47","resolution":{"observed_at":"2026-08-10T20:42:31.609586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09668","last_updated":"2025-01-19T02:46:28Z","snapshot_observed_at":"2026-08-16T13:18:27.863378Z","submitted_at":"2024-09-15T08:43:18Z","title":"EditBoard: Towards a Comprehensive Evaluation Benchmark for Text-Based Video Editing Models","version":2},"cited_work":{"arxiv_id":"2409.09668","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.09668","snapshot_observed_at":"2026-08-10T20:42:32.180489Z","title":"EditBoard: Towards a Comprehensive Evaluation Benchmark for Text-Based Video Editing Models","venue":"cs.CV","work_id":"49bb066f-c50e-4cd6-acba-46515a1fa3c7","year":2024},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.618642Z"},"links":{"cited_paper":"/paper/2409.09668","citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:5cc0b0408b36ae7459f6c6365c698536d7515cff956dff80b0d9a7caf88731c1","observation_id":"3ea98bb1-999f-4318-9c07-99ef3c32ea2e","resolution":{"observed_at":"2026-08-10T20:42:32.192878Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:42:32.881420Z","title":"Clip-adapter: Better vision-language models with fea- ture adapters","venue":null,"work_id":"f69c4a1c-af91-40d8-a1e2-b4a409e42e4d","year":2024},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.629915Z"},"links":{"citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:b2db2f7afdf4819f60cd34dd648ce393caeb89d8ef253eadb0f172631dcf3b4a","observation_id":"4f839925-9cd3-4f87-a370-b4f8dd1f9097","resolution":{"observed_at":"2026-08-10T20:42:32.893419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10373","last_updated":"2023-11-20T10:54:09Z","snapshot_observed_at":"2026-08-15T03:17:05.670808Z","submitted_at":"2023-07-19T18:00:03Z","title":"TokenFlow: Consistent Diffusion Features for Consistent Video Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10373","snapshot_observed_at":"2026-08-10T20:42:31.638700Z","title":"Tokenflow: Consistent diffusion features for consistent video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.638700Z"},"links":{"cited_paper":"/paper/2307.10373","citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:07d27f8481593095975c45ef8015a51b022c5f8732c759294ca470d3114a9826","observation_id":"77dce725-1a90-42c1-8461-636a555e1769","resolution":{"observed_at":"2026-08-10T20:42:31.638700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:42:32.843894Z","title":"Enhancing the video editing capabilities of text-to-video generators using ddpm inversion","venue":null,"work_id":"423acd15-48e7-4f02-b400-d06a16492b9a","year":2023},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.647850Z"},"links":{"citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:8ae8b2dac919f5d84435839536549e0984f91868b62ceca14bbcbfcdc32bee60","observation_id":"8e1e698a-bd57-4bc2-8507-4990874be4c2","resolution":{"observed_at":"2026-08-10T20:42:32.850981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14841","last_updated":"2024-07-20T10:55:19Z","snapshot_observed_at":"2026-08-16T13:32:30.446500Z","submitted_at":"2024-07-20T10:55:19Z","title":"Text-based Talking Video Editing with Cascaded Conditional Diffusion","version":1},"cited_work":{"arxiv_id":"2407.14841","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.14841","snapshot_observed_at":"2026-08-10T20:42:32.104485Z","title":"Text-based Talking Video Editing with Cascaded Conditional Diffusion","venue":"cs.CV","work_id":"4bff2b3a-b220-4440-b75c-e50e807a7cbe","year":2024},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.655451Z"},"links":{"cited_paper":"/paper/2407.14841","citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:89b54820874645c2ed60fcb4fedf45c130eaae49a68e8caee20f641ef19a186a","observation_id":"c0f74ddc-28c9-4946-aa9e-8a805ae7567c","resolution":{"observed_at":"2026-08-10T20:42:32.112207Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:42:32.816400Z","title":"ultralytics/yolov5: v6","venue":null,"work_id":"4ebb8224-2a53-4964-a667-659d26eeac5c","year":2022},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.665705Z"},"links":{"citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:b9d3dacb468964c43ebac3a89cff612a2bf1443902a53e42984ee9656b7e55f9","observation_id":"7ee745d7-dfcc-4819-893c-bed2e4b7139e","resolution":{"observed_at":"2026-08-10T20:42:32.822953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:42:32.790024Z","title":"Vilt: Vision- and-language transformer without convolution or region su- pervision","venue":null,"work_id":"ec0dc1c2-3785-45a9-b61b-394835b2c501","year":2021},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.674915Z"},"links":{"citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:0a7842793d4daf9e1d9c6febc09e08eaca07384894deeca95fd5013ff4955b73","observation_id":"521c2502-1795-4146-ad13-6ade0265f007","resolution":{"observed_at":"2026-08-10T20:42:32.800719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:42:32.768444Z","title":"Segment any- thing","venue":null,"work_id":"f62e2ec1-4362-4a96-a5dd-95485e26ceca","year":2023},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.684518Z"},"links":{"citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:bffff03958c360862a1a928fc5cf1ee6af6fc7c184e561b4fef49219f70b90e0","observation_id":"c7a53771-99f1-4548-a29b-6de66bc4ec26","resolution":{"observed_at":"2026-08-10T20:42:32.774534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14468","last_updated":"2024-11-03T21:16:54Z","snapshot_observed_at":"2026-08-16T14:07:39.359261Z","submitted_at":"2024-03-21T15:15:00Z","title":"AnyV2V: A Tuning-Free Framework For Any Video-to-Video Editing Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14468","snapshot_observed_at":"2026-08-10T20:42:31.692746Z","title":"Anyv2v: A plug-and-play framework for any video- to-video editing tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.692746Z"},"links":{"cited_paper":"/paper/2403.14468","citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:e3c7a147d2e4587fa2d6f5b38fffd1bc1ab65c59d58db7cd300f98eb529965b8","observation_id":"47f2576a-b26c-4b9b-ac2a-11040c167a98","resolution":{"observed_at":"2026-08-10T20:42:31.692746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:42:32.743232Z","title":"Shape-aware text-driven lay- ered video editing","venue":null,"work_id":"6c21f482-30c1-4410-8075-42f604d2bcdc","year":2023},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.701768Z"},"links":{"citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:af3a7dbe8e951722bd1dfbb3ad3e89936185a57b20d8d72657cd1949f8b51670","observation_id":"79454fb2-a119-498d-90c7-57f9f6afec31","resolution":{"observed_at":"2026-08-10T20:42:32.753052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:42:31.708208Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.708208Z"},"links":{"citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:7a43c7be2fe3847aec79c242f5489461fdd6d8c0324c4873c317b97d43d9ca28","observation_id":"beca871b-6f7f-4781-9cc8-7c2bc8a4c4a8","resolution":{"observed_at":"2026-08-10T20:42:31.708208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:42:32.694436Z","title":"Vidtome: Video token merging for zero-shot video editing","venue":null,"work_id":"c51ecb0e-9f3a-43f0-aafe-4f26c3236bc7","year":2024},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.719066Z"},"links":{"citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:f01288db4c68174de34ac77dd36c5cf2487a7d14e6d3dae47afb28c2ae855ab3","observation_id":"20cc6552-8158-4efe-a95c-7fd4a5cce111","resolution":{"observed_at":"2026-08-10T20:42:32.702555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:42:32.665617Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"10f907bf-dcc4-45d5-9398-253e079a611e","year":2025},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.729724Z"},"links":{"citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:c813e4a5c05ae896c5a1f141fe137502067083dce6a4c644a8db2c54ff2522d0","observation_id":"ae2c48f6-4d0a-431f-8163-7adc9f0db45b","resolution":{"observed_at":"2026-08-10T20:42:32.676393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:42:32.636797Z","title":"Video-p2p: Video editing with cross-attention control","venue":null,"work_id":"79fd9d16-0755-4e7b-a1af-76fddbd86b45","year":2024},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.737843Z"},"links":{"citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:9ce3ef5f51d33600c3c813326a0148f597fea6ba478604b0e0743de0990ebf49","observation_id":"2aae9f3b-ea1c-4fbd-80a5-d965136920b3","resolution":{"observed_at":"2026-08-10T20:42:32.646449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00896","last_updated":"2024-04-08T18:40:31Z","snapshot_observed_at":"2026-08-16T14:30:39.441629Z","submitted_at":"2023-12-31T10:51:52Z","title":"TrailBlazer: Trajectory Control for Diffusion-Based Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00896","snapshot_observed_at":"2026-08-10T20:42:31.744859Z","title":"Trailblazer: Trajectory control for diffusion-based video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.744859Z"},"links":{"cited_paper":"/paper/2401.00896","citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:d383537960947a76ef06a72c40e8ec9ab45d1b3b3e1e670fd42bf770528676c5","observation_id":"7818f995-9564-4e6d-b8b9-1c6be52192c9","resolution":{"observed_at":"2026-08-10T20:42:31.744859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:42:32.608978Z","title":"Gazed–gaze-guided cinematic editing of wide-angle monocular video recordings","venue":null,"work_id":"1d4542bb-c1e7-483b-8fec-d0bf937d692e","year":2020},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.752271Z"},"links":{"citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:590e5b17be6e983730fca3bd5495c555de6f86989be41544939a5182a3928604","observation_id":"ee6f2988-171e-4fe0-9bea-86a3cafb8b7a","resolution":{"observed_at":"2026-08-10T20:42:32.617147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:42:32.579896Z","title":"Fatezero: Fus- ing attentions for zero-shot text-based video editing","venue":null,"work_id":"7c9f25fe-815b-4f7c-ad35-b82b751b7de5","year":2023},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.764726Z"},"links":{"citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:0bced8bb8b8a58b4a0225c89161a03ad4ea2732e76bc2bf2be2d027bfd6d35d3","observation_id":"ad541a63-3434-4ea7-a4c6-be9aabd57398","resolution":{"observed_at":"2026-08-10T20:42:32.588539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:42:32.552903Z","title":"Enhanced end-to-end video editing: Adaptive customization of path, object, and motion dynam- ics","venue":null,"work_id":"e0232046-a4d0-4c09-a28f-9aba000261f7","year":null},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.779861Z"},"links":{"citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:6d9612486b30319b38dea31a7849c6d7011652e9fe5f4583c130ce89c642b884","observation_id":"2540c33d-c6d7-4004-afa9-625c574a117f","resolution":{"observed_at":"2026-08-10T20:42:32.561206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:42:32.524638Z","title":"Pro- cedural crowd generation for semantically augmented virtual cities","venue":null,"work_id":"11cb02be-1bc8-4be1-9772-465e5e92bd30","year":2021},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.791223Z"},"links":{"citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:dbc4de127c1883bbb3a2ac84f94efa840ac719ff64438f26cd84c18942e10d2c","observation_id":"1b9d67d4-c46f-4683-805a-662d556dcbc5","resolution":{"observed_at":"2026-08-10T20:42:32.533346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:42:31.800012Z","title":"Yolov7: Trainable bag-of-freebies sets new state-of-the-art for real-time object detectors","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.800012Z"},"links":{"citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:fc73d98d8de4ebf7e2cee95f3073eb18d680a37b4f792762da58177e731ce012","observation_id":"c3c4c8ca-a9d7-4fce-b741-b6e35ebebe80","resolution":{"observed_at":"2026-08-10T20:42:31.800012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:42:32.483357Z","title":"Actionclip: Adapting language-image pretrained models for video action recognition","venue":null,"work_id":"407e6963-5f59-4286-a554-2bd2cd28643b","year":2023},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.807770Z"},"links":{"citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:1572b922a1d7c63f0f5e1fd1b57020443d352b2275a6db5d0959d3752dce9e42","observation_id":"bd7b1a1b-5fee-4b89-82a7-80d80ec6358f","resolution":{"observed_at":"2026-08-10T20:42:32.492677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10163","last_updated":"2022-10-18T21:06:29Z","snapshot_observed_at":"2026-08-16T16:23:03.490700Z","submitted_at":"2022-10-18T21:06:29Z","title":"MedCLIP: Contrastive Learning from Unpaired Medical Images and Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10163","snapshot_observed_at":"2026-08-10T20:42:31.815860Z","title":"Medclip: Contrastive learning from unpaired medical images and text","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.815860Z"},"links":{"cited_paper":"/paper/2210.10163","citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:0b55f0493a271db204d6aab2c1badc2540dc4c7d66764110f1e14596fd283acf","observation_id":"8ad1278e-5828-4f00-ad50-a55d8667cae8","resolution":{"observed_at":"2026-08-10T20:42:31.815860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:42:31.825184Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.825184Z"},"links":{"citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:acc3eb62ae084e6d758730999c95a8a9cf74fe73c4c6cd1cdca8c9334a386570","observation_id":"c9d04de6-7bf2-4d94-9cac-776af417d893","resolution":{"observed_at":"2026-08-10T20:42:31.825184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:42:32.435742Z","title":"Florence-2: Advancing a unified representation for a variety of vision tasks","venue":null,"work_id":"ce85094c-dd37-413e-ae89-38f83c665c92","year":2024},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.834435Z"},"links":{"citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:53db3d9044ae27ab822b17247f54a1870f2af577412d3d5143db350a09dc9cdb","observation_id":"93072393-8846-4e5d-b095-09bb36a68b05","resolution":{"observed_at":"2026-08-10T20:42:32.447522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:42:32.412298Z","title":"Temporally consistent semantic video editing","venue":null,"work_id":"9473de16-147b-4883-97bb-50e1463a4284","year":2022},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.844142Z"},"links":{"citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:ada6046f50714147efa3ba54c47a133e73c8c996fffaa7a7cca2870b6b8bc60e","observation_id":"0e1a16af-b1a6-41a4-9fec-753fb24a3d02","resolution":{"observed_at":"2026-08-10T20:42:32.421605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:42:32.382376Z","title":"Context-aware talking-head video editing","venue":null,"work_id":"475a9ef7-7053-4b83-9a9a-7ad6d3b24b27","year":2023},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.851364Z"},"links":{"citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:c4372871422a0e596aacf7208860500dbf81485f6f31bd012d5c8ba9e1ee6947","observation_id":"0f59556f-a314-4459-9846-2604fd3f692a","resolution":{"observed_at":"2026-08-10T20:42:32.391770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08845","last_updated":"2024-10-31T08:38:26Z","snapshot_observed_at":"2026-08-16T13:43:28.740883Z","submitted_at":"2024-06-13T06:09:22Z","title":"Rethinking Human Evaluation Protocol for Text-to-Video Models: Enhancing Reliability,Reproducibility, and Practicality","version":4},"cited_work":{"arxiv_id":"2406.08845","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.08845","snapshot_observed_at":"2026-08-10T20:42:31.993451Z","title":"Rethinking Human Evaluation Protocol for Text-to-Video Models: Enhancing Reliability,Reproducibility, and Practicality","venue":"cs.CV","work_id":"f0c7e54c-7481-416f-b8a9-616d5d69c699","year":2024},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.864250Z"},"links":{"cited_paper":"/paper/2406.08845","citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:9d335b1990d162d08de61e3a76f4c877ac3434900ddeccac76f11c9ffcaadbfd","observation_id":"72ac9507-7d40-4dc9-aa4a-0c4538349109","resolution":{"observed_at":"2026-08-10T20:42:32.004189Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:42:32.338979Z","title":"Motiondirector: Motion customization of text-to-video diffusion models","venue":null,"work_id":"6f72f0bd-3e2e-4e65-badf-de827bd8e78d","year":2025},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.873471Z"},"links":{"citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:9c36f94e6cba6d3289cabbcd6266aece2e1d751a7f8583592ac40f1fc080b252","observation_id":"d4388d50-4b4b-4850-94d6-cf47385e8094","resolution":{"observed_at":"2026-08-10T20:42:32.353751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04159","last_updated":"2021-03-18T03:14:26Z","snapshot_observed_at":"2026-08-13T17:54:01.724774Z","submitted_at":"2020-10-08T17:59:21Z","title":"Deformable DETR: Deformable Transformers for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04159","snapshot_observed_at":"2026-08-10T20:42:31.879391Z","title":"Deformable detr: Deformable trans- formers for end-to-end object detection","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T20:42:31.879391Z"},"links":{"cited_paper":"/paper/2010.04159","citing_paper":"/paper/2501.07554"},"observation_digest":"sha256:ce315e70526cbe801d8485663d789df8995ea0743fd0dfd1ee066a4182570c44","observation_id":"ae470dc1-653f-435b-b9e0-1552428baf80","resolution":{"observed_at":"2026-08-10T20:42:31.879391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.07554","last_updated":"2025-01-13T18:37:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T01:05:56.899796Z","submitted_at":"2025-01-13T18:37:08Z","title":"SST-EM: Advanced Metrics for Evaluating Semantic, Spatial and Temporal Aspects in Video Editing"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":3,"verified_fuzzy":21},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2501.07554."}