{"as_of":"2026-08-08T03:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a8b5535f43dcb22b955b62064f03e18d62c9a1da64b3707d92f1896b3aa42410","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:58:20.867051Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.22868/citation-record","integrity":"/paper/2506.22868/integrity","json":"/paper/2506.22868/citation-record.json","paper":"/paper/2506.22868"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:24.779811Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"0329c6f3-8c83-4629-825c-01b13295cfe7","year":2020},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:17.548575Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:cb0e0ecdee48ebb412a04be9bcc5d832de4a7f1e9b33f9ca989563bffce4a38d","observation_id":"5e74f456-8650-4173-be87-565e6a239d3b","resolution":{"observed_at":"2026-08-06T21:58:24.816014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:17.655661Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:17.655661Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:009ccd53e7527f68f3e988865454f40dab0dbba0c6a69f0a384e195b4a899c1a","observation_id":"0a455bb6-a9dc-4241-b35f-8c306e1ab19c","resolution":{"observed_at":"2026-08-06T21:58:17.655661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:17.820669Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:17.820669Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:4d196d69640e67885dc2040231cb82545a196efd6c6f53f01647690f8a6e56f3","observation_id":"b8d1f45a-fe28-4dbb-bb9d-7eb102f9440f","resolution":{"observed_at":"2026-08-06T21:58:17.820669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:24.650811Z","title":"Masactrl: Tuning-free mutual self-attention control for consistent image synthesis and editing","venue":null,"work_id":"373440a2-8df2-4be2-b4ce-e07263bc2496","year":2023},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:17.935195Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:1190039d75d943a2b563f311c0a1f4c116ad78fb241e5d779656b0a578d466d1","observation_id":"107e24cd-4f68-4bc1-98e1-37209ca6c7c0","resolution":{"observed_at":"2026-08-06T21:58:24.702536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:18.052273Z","title":"Prompt-to-prompt image editing with cross attention control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:18.052273Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:b65df413c2f444bd0d1c2d7ed3aa38c474242e35d8ed8d903a769c312c8b51d6","observation_id":"7cd4fdec-6816-4bc0-993a-374ed89aedb3","resolution":{"observed_at":"2026-08-06T21:58:18.052273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:18.095880Z","title":"Plug-and-play diffusion features for text-driven image-to-image translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:18.095880Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:12ea0641ec0d4b62a912b7f4b00db09f2a4ee1ddfec189fd62caceabd651aa06","observation_id":"d35b103f-4a85-4b55-ab8c-94281935532d","resolution":{"observed_at":"2026-08-06T21:58:18.095880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:24.499325Z","title":"Zero-shot image-to-image translation","venue":null,"work_id":"6fd20596-f0d8-4883-b785-efaa6f5d0d2f","year":2023},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:18.191747Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:2237046d8bb5c32d83b8d6497f9a5fcfd6afce117dd33c9408b512936bdd2551","observation_id":"922ab1d7-938a-403a-a33f-ddf1d5c4041a","resolution":{"observed_at":"2026-08-06T21:58:24.546779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:24.333838Z","title":"Diffusion-based conditional image editing through optimized inference with guidance","venue":null,"work_id":"55a3f5e6-3f12-45c7-9407-d6a7e7d1eb45","year":2025},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:18.239810Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:c67b741258e3888a4483843a86bbc5c06157703e95aec2eb4f94b8739bfea0f3","observation_id":"4ffa6e88-a951-4ab8-bfd7-4f553d2c6256","resolution":{"observed_at":"2026-08-06T21:58:24.435134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20484","last_updated":"2025-03-26T12:15:25Z","snapshot_observed_at":"2026-08-07T16:35:44.745000Z","submitted_at":"2025-03-26T12:15:25Z","title":"Contrastive Learning Guided Latent Diffusion Model for Image-to-Image Translation","version":1},"cited_work":{"arxiv_id":"2503.20484","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.20484","snapshot_observed_at":"2026-08-06T21:58:21.277318Z","title":"Contrastive Learning Guided Latent Diffusion Model for Image-to-Image Translation","venue":"cs.CV","work_id":"87c67186-dad9-46e7-badf-058a08266a2d","year":2025},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:18.339617Z"},"links":{"cited_paper":"/paper/2503.20484","citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:f47a02385cc943948b003ebc509aa8ca7a403c76d517ffd114004e70e779bdf7","observation_id":"32715537-9fec-4306-8bdc-a846424c135d","resolution":{"observed_at":"2026-08-06T21:58:21.369912Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:24.159148Z","title":"Imagic: Text-based real image editing with diffusion models","venue":null,"work_id":"debe7035-8ee0-428a-9cb8-16c7b2393dfd","year":2023},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:18.424360Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:cb18e2dbd09e31e23677b7abfd8c37c21ea9dcc1a0cb3ee0b1d16bb305006ac4","observation_id":"873a7229-90dd-474e-8195-c17a7a193b5e","resolution":{"observed_at":"2026-08-06T21:58:24.269288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:24.008694Z","title":"Diffusion-based image-to-image translation by noise correction via prompt interpolation","venue":null,"work_id":"ce290626-761a-4e3d-aa56-f31afaf7ee13","year":2024},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:18.496822Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:eff1788d3e9f5234a3fbf863d2a64022a57835b96566782c558b289f4acee845","observation_id":"c13b1b38-61da-45b5-a693-3212ca8e3ec7","resolution":{"observed_at":"2026-08-06T21:58:24.083225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:23.889715Z","title":"Fatezero: Fusing attentions for zero-shot text-based video editing","venue":null,"work_id":"240cc3f4-c56b-49b0-966c-41c0e8979106","year":2023},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:18.604831Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:3e3d6c5761ba7782540ec15b8c8a24c40e30db423e7a9ab5567295cd83659a10","observation_id":"b547edd8-55f9-42be-89bc-808ff42db11e","resolution":{"observed_at":"2026-08-06T21:58:23.947233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:23.781253Z","title":"Ground-a-video: Zero-shot grounded video editing using text-to-image diffusion models","venue":null,"work_id":"83bc933b-f5f0-4608-b2aa-da42e2e3abc1","year":2024},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:18.658776Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:53d33b8836e0e72dd111ecb9718ae90a8b1466c0a342fc2c6aa25c25cf2a1e43","observation_id":"213f5a34-c815-4097-9e1f-f6533f66d8c2","resolution":{"observed_at":"2026-08-06T21:58:23.840518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:23.606312Z","title":"Flatten: Optical flow-guided attention for consistent text-to-video editing","venue":null,"work_id":"83876e93-3cbc-4edf-9c7c-f54f62da60a6","year":2024},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:18.748764Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:609d3a8ea82155428a3f36c9e7e475827086db27ece3b1bc8ff2bae78bb1ed02","observation_id":"00da7c19-34bc-4ec4-b69a-88af6dfed89a","resolution":{"observed_at":"2026-08-06T21:58:23.692616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:23.427470Z","title":"Videograin: Modulating space-time attention for multi-grained video editing","venue":null,"work_id":"e9aa07e5-f522-4015-9e5f-a790ea172d70","year":2025},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:18.854827Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:5fad67d03dbcc5053519e403a2fde3272d2662754908ef365012646964fc633a","observation_id":"8029e461-c15a-4368-a52f-e093bcd6fad3","resolution":{"observed_at":"2026-08-06T21:58:23.510644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05275","last_updated":"2024-12-06T18:59:12Z","snapshot_observed_at":"2026-07-06T20:02:57.733746Z","submitted_at":"2024-12-06T18:59:12Z","title":"MotionFlow: Attention-Driven Motion Transfer in Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05275","snapshot_observed_at":"2026-08-06T21:58:18.941915Z","title":"Motionflow: Attention-driven motion transfer in video diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:18.941915Z"},"links":{"cited_paper":"/paper/2412.05275","citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:43142090192a46fcbd9cc600f7e62bd1dd903ad7b8ac89a744abcdd29f95ba54","observation_id":"e82dd3cc-86c2-4191-846b-b7efb7a306f5","resolution":{"observed_at":"2026-08-06T21:58:18.941915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:23.233664Z","title":"Space-time diffusion features for zero-shot text-driven motion transfer","venue":null,"work_id":"105d041e-e4fd-4ecb-9cb4-852c76d965d0","year":2024},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:19.000948Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:b3375f9dc7f22aa9cec803e2fdb94e41664a0c1d45db525239a83d25503b62bf","observation_id":"fe586e70-3c36-49c0-a6bc-1ea795a58e7f","resolution":{"observed_at":"2026-08-06T21:58:23.335708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07563","last_updated":"2025-01-13T18:53:08Z","snapshot_observed_at":"2026-08-06T00:23:29.895816Z","submitted_at":"2025-01-13T18:53:08Z","title":"Training-Free Motion-Guided Video Generation with Enhanced Temporal Consistency Using Motion Consistency Loss","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07563","snapshot_observed_at":"2026-08-06T21:58:19.098685Z","title":"Training-free motion-guided video generation with enhanced temporal consistency using motion consistency loss","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:19.098685Z"},"links":{"cited_paper":"/paper/2501.07563","citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:6d22d347267c87c4d57e5d3868037b6622bf5d0a17a33950f9bca7e0a709fb9c","observation_id":"48e4c4a0-03a6-4156-a7d1-2bccfee42363","resolution":{"observed_at":"2026-08-06T21:58:19.098685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13185","last_updated":"2024-04-07T12:11:28Z","snapshot_observed_at":"2026-08-04T22:46:26.821486Z","submitted_at":"2024-02-20T17:52:12Z","title":"UniEdit: A Unified Tuning-Free Framework for Video Motion and Appearance Editing","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13185","snapshot_observed_at":"2026-08-06T21:58:19.169735Z","title":"Uniedit: A unified tuning-free framework for video motion and appearance editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:19.169735Z"},"links":{"cited_paper":"/paper/2402.13185","citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:b109035e1e745d62857389f694fd2708c2a974b346e6688aa5a2645bd3026e62","observation_id":"35b42fb0-da08-4b86-aec2-87dee749593c","resolution":{"observed_at":"2026-08-06T21:58:19.169735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:23.053462Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":"81404e79-5642-45cb-94f4-09e289dfdf55","year":2024},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:19.304177Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:12b3d255808b6c700b42833140e0c2db7776c30b0617e57fa9500550b31d7e44","observation_id":"711a8b93-4d1d-4d0c-8bc9-76791c13f96d","resolution":{"observed_at":"2026-08-06T21:58:23.124861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:22.825027Z","title":"Lavie: High-quality video generation with cascaded latent diffusion models","venue":null,"work_id":"82ed4526-62d5-4a62-80a9-ed6ec32176e5","year":2024},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:19.383976Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:73b340b8b7f6cd237c54802c2da4e44100689d5cb0efbade9555baa2c6a90252","observation_id":"d715c2bb-58a6-4ded-adad-b4256979c1a3","resolution":{"observed_at":"2026-08-06T21:58:22.926987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:22.637611Z","title":"xformers: A modular and hack- able transformer modelling library","venue":null,"work_id":"9784c19a-d105-443c-ba81-1d26be39a5e8","year":2022},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:19.476075Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:da772f849e109ddee5b05f6aab16a916af2c85c69b6492543bf5a7d40b79b437","observation_id":"7f1c43dd-7448-41b0-81fc-6011d74e3b19","resolution":{"observed_at":"2026-08-06T21:58:22.729405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:22.419521Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":"5d9f888c-7158-4da1-9f49-1772b1ff2f18","year":2022},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:19.555041Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:266d7f9fe243ecca59698cea9ac5ac732cd5af6ddc4f1a4e981b548133ea34d1","observation_id":"d252c641-7901-4f73-964c-068b42da3100","resolution":{"observed_at":"2026-08-06T21:58:22.526603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:19.621676Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:19.621676Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:97e386f0c17fcf1fcde8fc3ff09a7e9e363aa9239d622ad28e0c4490e44a62ea","observation_id":"8839af71-a749-41f0-a6f1-2ce3d380d583","resolution":{"observed_at":"2026-08-06T21:58:19.621676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09642","last_updated":"2026-03-02T11:31:23Z","snapshot_observed_at":"2026-08-02T11:33:41.662779Z","submitted_at":"2025-03-12T05:00:07Z","title":"Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09642","snapshot_observed_at":"2026-08-06T21:58:19.736689Z","title":"Open-sora 2.0: Training a commercial-level video generation model in $200k","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:19.736689Z"},"links":{"cited_paper":"/paper/2503.09642","citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:420dc54534fa7fbeec40a656a2aebca63f65235afd4a3f10e3976b6c07419251","observation_id":"20279b19-f2fa-4203-854a-7eaffbecba57","resolution":{"observed_at":"2026-08-06T21:58:19.736689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:22.260005Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":"6c9345d6-a4e7-46a7-9cec-ef27c57c92e9","year":2023},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:19.836926Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:b04c656d30f114b733b64a0e3a92a8c5b980a251173c0a9d392c953d086c090e","observation_id":"f81c149c-9cd6-42c5-b1f9-780c84b5eb49","resolution":{"observed_at":"2026-08-06T21:58:22.326965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:19.924667Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:19.924667Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:6a70cebf0d75923fdb3b57d57dc2a9e9658be7d08182895cfed1e933a70d4513","observation_id":"353db1de-2c42-4ba2-981c-f5f832c53a03","resolution":{"observed_at":"2026-08-06T21:58:19.924667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12288","last_updated":"2023-02-23T19:13:10Z","snapshot_observed_at":"2026-07-06T14:55:15.719380Z","submitted_at":"2023-02-23T19:13:10Z","title":"ZoeDepth: Zero-shot Transfer by Combining Relative and Metric Depth","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12288","snapshot_observed_at":"2026-08-06T21:58:20.015575Z","title":"Zoedepth: Zero-shot transfer by combining relative and metric depth","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:20.015575Z"},"links":{"cited_paper":"/paper/2302.12288","citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:6122bff6c6e7435ffd6e4b3ae02c9e5532b0fa30cfdb1fa77d9f90f84c73d91d","observation_id":"e92248f5-fd44-4016-bed4-f6fa8cc1f4f5","resolution":{"observed_at":"2026-08-06T21:58:20.015575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:20.134361Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:20.134361Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:34073d736e6257bcd432e993c86624a2e5c78fdc2065a9f303c3d01b857c6d1a","observation_id":"0941b655-dbeb-4eb2-9602-ab1fde92ebb6","resolution":{"observed_at":"2026-08-06T21:58:20.134361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06558","last_updated":"2023-05-11T04:33:08Z","snapshot_observed_at":"2026-08-03T19:49:16.800693Z","submitted_at":"2023-05-11T04:33:08Z","title":"Segment and Track Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06558","snapshot_observed_at":"2026-08-06T21:58:20.179134Z","title":"Segment and track anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:20.179134Z"},"links":{"cited_paper":"/paper/2305.06558","citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:6d0a33b4690854c8b8d8891eee60d4e8a1153f8255f72f2c402b133ad261ec57","observation_id":"9fb9494b-f604-4bec-bb6a-b100b8452b68","resolution":{"observed_at":"2026-08-06T21:58:20.179134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:22.080919Z","title":"Simple open-vocabulary object detection","venue":null,"work_id":"31186074-2089-4d3b-b8a0-0174c911973b","year":2022},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:20.276208Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:f1cce7655ef5f8fb5a787ba90688b5a1c0516edd1d871df252c171e1e928e1df","observation_id":"1eb3b22d-476f-4235-b34f-8c69f500a7f8","resolution":{"observed_at":"2026-08-06T21:58:22.152618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:21.944069Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":"bd399a9c-586b-4e3c-8770-72020f491c65","year":2021},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:20.367889Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:adc6532fba22f9221f88d209806672174ec290828dcfe6100ba753061e6992f8","observation_id":"bf5cd6b0-a255-4458-a194-c13574e158ad","resolution":{"observed_at":"2026-08-06T21:58:22.020567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16003","last_updated":"2023-10-24T16:56:58Z","snapshot_observed_at":"2026-08-01T15:51:11.290263Z","submitted_at":"2023-10-24T16:56:58Z","title":"CVPR 2023 Text Guided Video Editing Competition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16003","snapshot_observed_at":"2026-08-06T21:58:20.436889Z","title":"Cvpr 2023 text guided video editing competition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:20.436889Z"},"links":{"cited_paper":"/paper/2310.16003","citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:92d16f47576a209d486ee8b9583a58534bb0c885fb5865460388f8596da4e2f8","observation_id":"41243e34-8d12-4ebc-a532-7e5ec9ba7103","resolution":{"observed_at":"2026-08-06T21:58:20.436889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-06T21:58:20.495158Z","title":"Videollama 3: Frontier multimodal foundation models for image and video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:20.495158Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:90ec496565917719baf8ef3b3b6d70bd52ccf92963e3ad1c470f05eccb872ab4","observation_id":"23fc5b55-0769-450e-9dea-95e8c182564c","resolution":{"observed_at":"2026-08-06T21:58:20.495158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:21.824500Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":"cf70b230-6c89-421e-b8d3-34bd71aea641","year":2024},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:20.566749Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:e018e6f57295d5e044e0d5676e62a597e6cea1bbf90b5d7c4951f718dd890bd2","observation_id":"8050547f-13ea-4b48-90b8-e044b211af55","resolution":{"observed_at":"2026-08-06T21:58:21.891490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:21.677911Z","title":"Amt: All-pairs multi-field transforms for efficient frame interpolation","venue":null,"work_id":"75933b26-b065-461f-a5a7-9375e5a7550f","year":2023},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:20.674027Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:048acfe6c58d869550f709edf91b548d0e0a47e97ef51ad4836d0a184b580e9d","observation_id":"94c8b2bd-11fd-4ec2-a416-a9bd26a4ed84","resolution":{"observed_at":"2026-08-06T21:58:21.739232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:20.751219Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:20.751219Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:0dcf7dc51ec0981a15f7671f788058309b4ba378c4e36374ec3d54c14487f1ec","observation_id":"3d89db66-bef8-4376-ad15-9bff6d6d0cf3","resolution":{"observed_at":"2026-08-06T21:58:20.751219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:58:21.488175Z","title":"The unreason- able effectiveness of deep features as a perceptual metric","venue":null,"work_id":"70c4a614-53a3-4986-90bc-c669cc6c539b","year":2018},"citing_paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:20.867051Z"},"links":{"citing_paper":"/paper/2506.22868"},"observation_digest":"sha256:87f561d4f61b6b59c2a885507a6365feffc48a2eed90d8bad6985db85e90c936","observation_id":"653561fb-c589-4c72-8ba0-bc9ed96106d7","resolution":{"observed_at":"2026-08-06T21:58:21.615045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.22868","last_updated":"2025-06-28T12:36:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T20:26:16.536287Z","submitted_at":"2025-06-28T12:36:19Z","title":"STR-Match: Matching SpatioTemporal Relevance Score for Training-Free Video Editing"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2506.22868."}