{"as_of":"2026-08-06T18:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ab8baf9c8ebee2b679c171409b37c3c58596f088be583bcc8e2d2bf9eff56265","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T00:24:30.573122Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.04569/citation-record","integrity":"/paper/2605.04569/integrity","json":"/paper/2605.04569/citation-record.json","paper":"/paper/2605.04569"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T08:36:07.226215Z","title":"write newline","venue":null,"work_id":"8481976a-f196-4822-833d-e487ae5a1e81","year":null},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:af9c1edd6c6146d1fa9bd2dc4b61d763b26b971e2d6dc08f75d2f868a2ba7948","observation_id":"b7fc6738-3409-45dd-b95e-d381c522dd20","resolution":{"observed_at":"2026-07-07T08:53:32.122040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:53:32.117044Z","title":"Optimizing few-step generation with adaptive matching distillation","venue":null,"work_id":"f3f2e324-6020-4e1d-b9cd-0b8f511dec87","year":2026},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:462954cde6d0bc704e0408aa4e97fbdeef5d599552ef0ca0a3a1fb7a71dfbd15","observation_id":"bcca68fd-a6fb-4009-bb0a-2f4aa4e1e5a2","resolution":{"observed_at":"2026-07-07T08:53:32.118238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.15742","doi":"10.48550/arxiv.2510.15742","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2510.15742 , year=","venue":"ArXiv.org","work_id":"4db310ce-4ba1-4e8d-93a6-90134f0ff4e8","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:1ac710bd7959a52d9933fdb18798cc5580f073ea8c16261f51dcc5bf7e3eadcb","observation_id":"9b472ea8-2180-46a5-b68b-8b7ea8dc771c","resolution":{"observed_at":"2026-07-01T00:25:09.323474Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:15.826948+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:15.826948+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.22699","last_updated":"2026-07-06T06:19:03Z","snapshot_observed_at":"2026-08-03T19:47:26.577384Z","submitted_at":"2025-11-27T18:52:07Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","version":5},"cited_work":{"arxiv_id":"2511.22699","doi":"10.48550/arxiv.2511.22699","metadata_source":"pith","pith_arxiv_id":"2511.22699","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Z-Image: An Efficient Image Generation Foundation Model with Single-Stream Diffusion Transformer","venue":"cs.CV","work_id":"f1080a62-48e1-4255-b023-7556be57370d","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2511.22699","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:d1d796d345139876f9e43ee2d9d0ff53e2f00028d66989e8ce658208ae8e2ec1","observation_id":"b9e6f6f5-29df-494c-b074-86a36ec0e97a","resolution":{"observed_at":"2026-07-01T00:25:09.309077Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.152696+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13507","last_updated":"2025-12-23T17:38:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T16:36:52Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","version":3},"cited_work":{"arxiv_id":"2512.13507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.13507","snapshot_observed_at":"2026-07-10T01:46:40.967365Z","title":"Seedance 1.5 pro: A Native Audio-Visual Joint Generation Foundation Model","venue":"cs.CV","work_id":"02efb197-4e2b-4141-8587-21b92ad92f08","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2512.13507","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:2f305704b21273904fc379defe23f595475c322eef19037d197556e2faf7538c","observation_id":"122855f6-e584-415f-b32a-af388ff8196a","resolution":{"observed_at":"2026-07-01T00:25:09.297592Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.11647","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T21:16:14.748179Z","title":"Ivebench: Modern benchmark suite for instruction-guided video editing assessment","venue":null,"work_id":"0b16c73f-af59-410f-860e-ba21c3eb31cf","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:7ce2eb77fdd98efd311d55307c13d5024c0b06c57dfe4b32c263cef11678003d","observation_id":"e7bac4bb-ffb3-4bb9-bfb2-6618e257ad73","resolution":{"observed_at":"2026-07-01T00:25:09.351282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00213","last_updated":"2023-12-01T11:41:34Z","snapshot_observed_at":"2026-07-06T16:41:27.099792Z","submitted_at":"2023-11-01T01:20:12Z","title":"Consistent Video-to-Video Transfer Using Synthetic Dataset","version":3},"cited_work":{"arxiv_id":"2311.00213","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.00213","snapshot_observed_at":"2026-07-04T13:09:51.162552Z","title":"arXiv preprint arXiv:2311.00213 , year=","venue":null,"work_id":"d795adb5-f50a-4e89-a8a5-46b3551f6485","year":2023},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2311.00213","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:87e74f94ad0c69045ebce7f4b4f39e3edb93e2dcb6d6c8fd53a14c9109255b2d","observation_id":"6e1d12e2-912a-4e8e-aaf9-b1daff229aa4","resolution":{"observed_at":"2026-07-01T00:25:09.318863Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:f14cc197efd2a75d30804686626d8461e59c66353172a8a303e900b199202780","observation_id":"6909e8c6-1c0c-4fc8-97fe-ed2bdc31cd87","resolution":{"observed_at":"2026-07-01T00:25:09.268588Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18845","last_updated":"2025-06-04T08:36:19Z","snapshot_observed_at":"2026-07-06T20:42:51.341508Z","submitted_at":"2025-02-26T05:31:44Z","title":"Sliding Window Attention Training for Efficient Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.18845","doi":"10.48550/arxiv.2502.18845","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18845","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sliding window attention training for efficient large language models","venue":"ArXiv.org","work_id":"bfaf1468-70be-4e01-9473-42ce5e715f51","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2502.18845","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:bb201195591f4591d2fae6bf519a0c1fbc82938dcf769014149d9df5e4dc2ee8","observation_id":"cb757ed9-d768-473f-943a-8be85df54e38","resolution":{"observed_at":"2026-07-01T00:25:09.353545Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:53:32.127948Z","title":"Unity in diversity: Video editing via gradient-latent purification","venue":null,"work_id":"98d22676-b438-4f04-be70-ebaca777dccb","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:21aaa6ab70999361b5d13306933111f3557db3dae56a6c63a90fc5de74e4f4c3","observation_id":"f23d5f2d-f861-4635-833c-927325717ada","resolution":{"observed_at":"2026-07-07T08:53:32.129205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:53:32.115245Z","title":"Nano banana 2","venue":null,"work_id":"5d3f3249-26f4-4b10-aa3f-10b4b69dde44","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:d0518c788fe66b72b30a535e928f752e5dc20f9b758ffc6f84a903a43c235062","observation_id":"3efa1de1-2b74-49e7-a8a9-d6d770b0adc8","resolution":{"observed_at":"2026-07-07T08:53:32.116306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:53:32.104325Z","title":"Nano banana 2","venue":null,"work_id":"5e1f241f-c0cf-4616-9bda-e7edf99382e0","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:041a272da5ad682eb3f48c02bc6be25f8e8e09d705dc799881452c6944adceb0","observation_id":"862384d3-62c9-45d7-8f73-6c88a467ea2c","resolution":{"observed_at":"2026-07-07T08:53:32.105618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07598","last_updated":"2025-03-11T06:44:25Z","snapshot_observed_at":"2026-07-06T20:50:05.070886Z","submitted_at":"2025-03-10T17:57:04Z","title":"VACE: All-in-One Video Creation and Editing","version":2},"cited_work":{"arxiv_id":"2503.07598","doi":"10.48550/arxiv.2503.07598","metadata_source":"pith","pith_arxiv_id":"2503.07598","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"VACE: All-in-One Video Creation and Editing","venue":"cs.CV","work_id":"c68efbde-3431-4655-a337-87e2871ad6a3","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2503.07598","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:a6b5f0ac4104f44ad49fa237dea87464fc346ae2d874f950eb4c7f23d5be96a6","observation_id":"e8f32fae-7f1a-4bd1-b8d6-09dbae427ebd","resolution":{"observed_at":"2026-07-01T00:25:09.364649Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:14.2036+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:14.2036+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01506","last_updated":"2023-10-19T13:02:21Z","snapshot_observed_at":"2026-08-05T14:13:30.114970Z","submitted_at":"2023-10-02T18:01:55Z","title":"Direct Inversion: Boosting Diffusion-based Editing with 3 Lines of Code","version":2},"cited_work":{"arxiv_id":"2310.01506","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.01506","snapshot_observed_at":"2026-07-09T21:16:34.354064Z","title":"Direct inversion: Boosting diffusion-based edit- ing with 3 lines of code.arXiv preprint arXiv:2310.01506","venue":"cs.CV","work_id":"eba12495-cf75-42e3-9cbb-d8ea203a3f5f","year":2023},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2310.01506","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:8d17496b62640eaa2759be57efd28592e5ea9632fa58d29bddfbd30b4b38f613","observation_id":"11e0e8aa-e225-4866-93b2-5e243c22b6d0","resolution":{"observed_at":"2026-07-01T00:25:09.382312Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20360","last_updated":"2026-04-18T01:38:10Z","snapshot_observed_at":"2026-07-06T22:30:41.141182Z","submitted_at":"2025-09-24T17:59:30Z","title":"EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning","version":3},"cited_work":{"arxiv_id":"2509.20360","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.20360","snapshot_observed_at":"2026-07-04T13:09:51.206475Z","title":"EditVerse: Unifying Image and Video Editing and Generation with In-Context Learning","venue":"cs.CV","work_id":"3100bcea-8034-4051-8a0c-f45cde73d2d6","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2509.20360","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:27a15dcae306f82a573a57942e28cb69dbdecadc3fc6f41b31380fac272adef3","observation_id":"90eacc57-da65-481e-9884-07bad4da9ea1","resolution":{"observed_at":"2026-07-01T00:25:09.358752Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17725","last_updated":"2024-10-23T09:55:22Z","snapshot_observed_at":"2026-07-06T19:38:22.461739Z","submitted_at":"2024-10-23T09:55:22Z","title":"YOLOv11: An Overview of the Key Architectural Enhancements","version":1},"cited_work":{"arxiv_id":"2410.17725","doi":"10.48550/arxiv.2410.17725","metadata_source":"pith","pith_arxiv_id":"2410.17725","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"YOLOv11: An Overview of the Key Architectural Enhancements","venue":"cs.CV","work_id":"17e84c13-a2a4-4b25-9b05-ca4ca212abfa","year":2024},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2410.17725","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:c8d6666604751f1a6dcf1a87e7e1dab9ef2b99a52fadea3f04b8d08c30f100cd","observation_id":"6f23eb3a-068e-495c-8e35-b459064f4e5f","resolution":{"observed_at":"2026-07-01T00:25:09.372705Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-16T22:51:55.782635+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T22:51:55.782635+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-07-06T15:12:37.953383Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":"2304.02643","doi":"10.1109/iccv51070.2023.00371","metadata_source":"pith","pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Segment Anything","venue":"cs.CV","work_id":"2bbf46ca-720a-45a1-8e9c-10c33fbeada0","year":2023},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:4ea5e4671c431883a7a233d47c6a238286dd7e99211e56757d9f233df53b422d","observation_id":"44a13ab2-fedb-4bf5-a3e9-bc30be2bbb90","resolution":{"observed_at":"2026-07-01T00:25:09.282646Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:58.489975+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:58.489975+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01569","last_updated":"2023-11-23T17:07:58Z","snapshot_observed_at":"2026-08-05T16:14:24.029428Z","submitted_at":"2023-05-02T16:18:11Z","title":"Pick-a-Pic: An Open Dataset of User Preferences for Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2305.01569","doi":"10.48550/arxiv.2305.01569","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.01569","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Bram Wallace, Meihua Dang, Rafael Rafailov, Linqi Zhou, Aaron Lou, Senthil Purushwalkam, Stefano Ermon, Caiming Xiong, Shaﬁq Joty, and Nikhil Naik","venue":"arXiv (Cornell University)","work_id":"58b1cbac-c2d5-44dc-ae0b-bd451d77aab1","year":2023},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2305.01569","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:0545ba5160c5ddd3bf083b4e6af846971269ffc5563a9690d71fbdd408be4e4c","observation_id":"6a7c52e4-2582-4f38-a1a0-3614b6858acf","resolution":{"observed_at":"2026-07-01T00:25:09.378746Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:7c9387f108dfac927e12f01e13e176155a1ec9996760e5992bf89cd65419d861","observation_id":"1fe82452-82d7-4d79-befd-eebf619812fc","resolution":{"observed_at":"2026-07-01T00:25:09.375464Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14468","last_updated":"2024-11-03T21:16:54Z","snapshot_observed_at":"2026-07-06T17:48:24.076444Z","submitted_at":"2024-03-21T15:15:00Z","title":"AnyV2V: A Tuning-Free Framework For Any Video-to-Video Editing Tasks","version":4},"cited_work":{"arxiv_id":"2403.14468","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.14468","snapshot_observed_at":"2026-07-04T10:29:44.541818Z","title":"arXiv preprint arXiv:2403.14468 , year=","venue":null,"work_id":"91372074-cd42-4426-bf90-2d27dee1a1c9","year":2024},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2403.14468","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:48fc8612263f9dcc575184c75791aeffcc2189691848d045e522955c9ab0888a","observation_id":"4f8107cc-9958-40e1-8d8d-1544e1273b6b","resolution":{"observed_at":"2026-07-01T00:25:09.267051Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:53:32.088655Z","title":"Video diffusion models are strong video inpainter","venue":null,"work_id":"4cafbff8-e385-4b39-ad88-a3aff1f2a1d4","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:43ff3bd9ec206926db18add37e9cde4ad97515f01363ee0cf9f9eaafeae7aaeb","observation_id":"f28de582-5265-4413-9cae-96468a32adae","resolution":{"observed_at":"2026-07-07T08:53:32.089945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.01077","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:49:41.586816Z","title":"Pisa: Piecewise sparse attention is wiser for efficient diffusion transformers","venue":null,"work_id":"2b54676e-ec01-4f41-a01a-aab8df9f813a","year":2026},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:f899a26f20cec92f50ec4d1e990f70565c6b9809fe2506ca514c8c8bd45f59e4","observation_id":"54cfacb6-e55b-4045-acde-18ebaac46d7e","resolution":{"observed_at":"2026-07-01T00:25:09.275846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13684","last_updated":"2025-07-21T19:42:08Z","snapshot_observed_at":"2026-07-06T20:54:18.695103Z","submitted_at":"2025-03-17T19:47:41Z","title":"FiVE: A Fine-grained Video Editing Benchmark for Evaluating Emerging Diffusion and Rectified Flow Models","version":2},"cited_work":{"arxiv_id":"2503.13684","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.13684","snapshot_observed_at":"2026-07-01T07:55:30.911426Z","title":"Five: A fine-grained video editing benchmark for evaluating emerging diffusion and rectified flow models","venue":null,"work_id":"29bf032f-b7d8-4f1f-a0fe-da225aa14e11","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2503.13684","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:4e1bf9b7469209b322d482793f934f2ee46d976fba462fe9895a6c301d88a0da","observation_id":"4ebba8a0-7946-4408-b73c-b8568f69a650","resolution":{"observed_at":"2026-07-01T00:25:09.394781Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.19852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:49:41.548735Z","title":"Radial attention:O(nlogn)sparse attention with energy decay for long video generation","venue":null,"work_id":"f37b4eb0-dbad-4cee-a31f-d0b68241edc3","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:2d883b04be197c9628b35b07caae7999ca36bf3f7119d8a3a1e8d259d7e07c0c","observation_id":"b65bf1ab-98ac-4ae5-9c61-0b1b5767d441","resolution":{"observed_at":"2026-07-01T00:25:09.307704Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01801","last_updated":"2025-06-02T15:42:06Z","snapshot_observed_at":"2026-07-06T21:35:08.128554Z","submitted_at":"2025-06-02T15:42:06Z","title":"OmniV2V: Versatile Video Generation and Editing via Dynamic Content Manipulation","version":1},"cited_work":{"arxiv_id":"2506.01801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01801","snapshot_observed_at":"2026-07-01T06:35:29.300393Z","title":"Omniv2v: Versatile video generation and editing via dynamic content manipulation","venue":null,"work_id":"8b051987-70a4-457e-bf17-cc4efe2053ef","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2506.01801","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:949b0997508c1367dec2508cec1b93340741c0e889404efe27ee5b0cf4208a42","observation_id":"c8f6d9d7-f7ca-405d-a28a-027464cc43db","resolution":{"observed_at":"2026-07-01T00:25:09.369993Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.14648","doi":"10.48550/arxiv.2510.14648","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2510.14648 , year=","venue":"arXiv (Cornell University)","work_id":"bb8da1ea-a54e-48c3-b9b4-789e33744d25","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:c8bb98ac58d96eaa972b97bc18bae70e51dee93095fe40a7641f4e5a2bc29f39","observation_id":"c63c2060-25c0-4bd9-9a5c-c29c03797c95","resolution":{"observed_at":"2026-07-01T00:25:09.331030Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:16.980653+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:16.980653+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2409.07253","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T00:25:09.328637Z","title":"arXiv preprint arXiv:2409.07253 , year=","venue":null,"work_id":"19a6a5c8-d471-4fc9-8f10-2f868b2b5f11","year":2024},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:54136cfebd89d489e356cd3ac33d8abbc105e6c63f0f41b61ebc16eecb883267","observation_id":"7cc8ab4c-a17d-4ce1-ad25-5870d5501790","resolution":{"observed_at":"2026-07-01T00:25:09.330439Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:53:32.118826Z","title":"Stablev2v: Stabilizing shape consistency in video-to-video editing","venue":null,"work_id":"54e65037-e46d-4f47-9bbd-845d10e169ef","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:bd3f3a9d06ea8e4b7b6fc7c194c7c7028ee8ff0138d231e8878084ca11823966","observation_id":"28c8822b-ed1d-4811-b43d-6aabd0ea86fb","resolution":{"observed_at":"2026-07-07T08:53:32.120064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13918","last_updated":"2025-10-27T08:22:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-23T18:55:41Z","title":"Improving Video Generation with Human Feedback","version":2},"cited_work":{"arxiv_id":"2501.13918","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.13918","snapshot_observed_at":"2026-07-04T13:19:51.115512Z","title":"Improving Video Generation with Human Feedback","venue":"cs.CV","work_id":"cfe4c01d-1cf7-4a00-ba86-06d583ca2cff","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2501.13918","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:accadc4b4ab0660ff31208330241f90cf36bba3984523d4acab4aad304a86882","observation_id":"b4bff644-fe2f-488f-8596-359ddf780f70","resolution":{"observed_at":"2026-07-01T00:25:09.334514Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:53:32.122617Z","title":"Deepspeed","venue":null,"work_id":"41fb1e92-bfa9-41ee-9e00-66fe8bb4b1f4","year":2022},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:7364a1e3a975d70147004ea9be96154fb487f799807cc128347e44cefe65f611","observation_id":"d6966d7f-de1d-4b59-b9fe-bd7bb6e45bba","resolution":{"observed_at":"2026-07-07T08:53:32.123646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.08485","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T00:25:09.340142Z","title":"Instructx: Towards unified visual editing with mllm guidance.https://arxiv.org/abs/2510.08485","venue":null,"work_id":"1a3cea2f-0aa0-4f3a-95e4-31bae330525d","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:8dbc6c0029683a44bcd2208dccb98f94b9bd4774392c9c61bce421ebd5c84d51","observation_id":"426acee0-9c8b-4419-9fdf-cb289063d9bb","resolution":{"observed_at":"2026-07-01T00:25:09.342326Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:53:32.113590Z","title":null,"venue":null,"work_id":"82f386fa-c7fd-44c6-82cc-675135cfcdad","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:29be4994843bb9491e90ebd90925128481acc824fe3003ba9b80fe07974ccadc","observation_id":"90494ceb-c8a4-48d6-8a81-4cb825bf6d3f","resolution":{"observed_at":"2026-07-07T08:53:32.114655Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:53:32.100793Z","title":"K., Yuan, Z., and Wu, X","venue":null,"work_id":"bb77b642-2dd2-4040-a8f4-afc47f8e5c90","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:6f6e6b6e3c00623c12cf41b96de51fcc217df12042dbce516ac79b7020307549","observation_id":"9e89fc3c-b48c-4e18-8339-45828effbfe9","resolution":{"observed_at":"2026-07-07T08:53:32.101857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":"2401.14159","doi":"10.48550/arxiv.2401.14159","metadata_source":"pith","pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","venue":"cs.CV","work_id":"42c46ece-c4e8-4d5e-abae-f8d5b4208995","year":2024},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:66ec4cff5a2f501c13d4de6a309137e31fc986576712ed9543f64bbef5a497ef","observation_id":"761291bc-9237-4ddf-930a-65b65b27e566","resolution":{"observed_at":"2026-07-01T00:25:09.354305Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10769","last_updated":"2024-12-13T06:36:28Z","snapshot_observed_at":"2026-07-06T15:29:05.031168Z","submitted_at":"2023-05-18T07:23:12Z","title":"Catch-Up Distillation: You Only Need to Train Once for Accelerating Sampling","version":5},"cited_work":{"arxiv_id":"2305.10769","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10769","snapshot_observed_at":"2026-07-01T00:25:09.342026Z","title":"Catch-up distillation: You only need to train once for accelerating sampling","venue":null,"work_id":"999841d6-7ae3-4bfc-8055-3c279189f56d","year":2023},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2305.10769","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:5eeefbbfd316fe74f514385897b9de7b04349770c41053b2113925fe8be2c8bd","observation_id":"0ddde464-d9b1-4811-b8e3-46895623bf87","resolution":{"observed_at":"2026-07-01T00:25:09.344509Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13319","last_updated":"2025-03-31T11:03:18Z","snapshot_observed_at":"2026-07-06T20:54:00.272496Z","submitted_at":"2025-03-17T15:58:27Z","title":"MagicDistillation: Weak-to-Strong Video Distillation for Large-Scale Few-Step Synthesis","version":2},"cited_work":{"arxiv_id":"2503.13319","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.13319","snapshot_observed_at":"2026-07-03T20:48:55.720483Z","title":"Magicdistillation: Weak-to-strong video distillation for large-scale few-step synthesis","venue":null,"work_id":"bb8a052f-d70e-4522-91df-4a5c570391e5","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2503.13319","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:5fe84395edd5eef765560da479761fe8a54864b3e85a8833e9cc605bde7a58a4","observation_id":"02896e55-bb0e-4de8-aab0-d223a841cd9d","resolution":{"observed_at":"2026-07-01T00:25:09.287473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15911","last_updated":"2026-04-17T10:11:39Z","snapshot_observed_at":"2026-07-06T23:03:21.422544Z","submitted_at":"2026-04-17T10:11:39Z","title":"Efficient Video Diffusion Models: Advancements and Challenges","version":1},"cited_work":{"arxiv_id":"2604.15911","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.15911","snapshot_observed_at":"2026-07-08T14:44:59.784480Z","title":"Efficient Video Diffusion Models: Advancements and Challenges","venue":"cs.CV","work_id":"9a3b894d-552a-4b04-9f5e-762cbcca4de2","year":2026},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2604.15911","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:59484ac5c24954bfe3ab39d7fed0cc723e5703532f3dd8a07947da8cfd466d6b","observation_id":"1044ce48-1973-4d22-ba89-b59f248a7086","resolution":{"observed_at":"2026-07-01T00:25:09.328133Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2026.367498","doi":"10.1109/tpami.2026.3674984","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improved and accelerated text-to-image generation with collect, reflect, and refine","venue":"IEEE Transactions on Pattern Analysis and Machine Intelligence","work_id":"be286a4f-6e5a-463a-b4bf-9de04b5caa9b","year":2026},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:3cb3ab89fa80cd8223d58ca34a08b3bf45b53a51bd06ccfec79076611526f00c","observation_id":"76b56184-d992-49ba-9745-5066df07c867","resolution":{"observed_at":"2026-07-01T00:25:08.953651Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:53:32.086647Z","title":null,"venue":null,"work_id":"93c4d623-81dd-46a1-950f-fb0372dc2cc1","year":2026},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:f5c9c3b46d2eda5f5223783ab50a48bed33a84f1762e033a236b7d5101078f84","observation_id":"6ea5c7a5-7239-4d33-b4a5-c7a05de890e2","resolution":{"observed_at":"2026-07-07T08:53:32.087834Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:53:32.098989Z","title":"Kling 2.6","venue":null,"work_id":"0d45e97b-1dba-48ca-ab7c-8910a8b1c70e","year":2024},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:f8b344307718b3b7e20e3292ad5bb922d328d24674a50dae5eda16bc16287966","observation_id":"3fcfc83b-879d-47ca-9ba6-5270834ffb61","resolution":{"observed_at":"2026-07-07T08:53:32.100194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:53:32.124168Z","title":"Lucy edit: Open-weight text-guided video editing","venue":null,"work_id":"637c8ec5-76ef-4486-af54-9e49af2771b6","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:9a03becd09939ef174382429189ad0753bca0c0f7f2a8fdaf51e9e071993e78e","observation_id":"c903eb0e-8f46-4d4d-8c5a-80a39bd6e7e9","resolution":{"observed_at":"2026-07-07T08:53:32.125371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:53:32.108728Z","title":"T., and Cox, D","venue":null,"work_id":"d9e34120-ff33-4111-b80f-1fb6ef532c9d","year":2019},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:12254e0427eb67cf4c34ec84ee9d1583e429bc549920365c5f556379cdf9840d","observation_id":"aa672451-1b04-45ef-9ce2-41d0e24f12e2","resolution":{"observed_at":"2026-07-07T08:53:32.109923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17577","last_updated":"2025-04-27T11:11:02Z","snapshot_observed_at":"2026-07-06T21:14:14.909399Z","submitted_at":"2025-04-24T14:08:49Z","title":"TileLang: A Composable Tiled Programming Model for AI Systems","version":2},"cited_work":{"arxiv_id":"2504.17577","doi":"10.48550/arxiv.2504.17577","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.17577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"TileLang: A composable tiled programming model for AI systems","venue":"ArXiv.org","work_id":"d23477a7-29b7-478d-b57d-4a841906c2c6","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2504.17577","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:8d750a7ef967cb5bbb78269e0d0777e36e80dbfdef6598b9871dfd1222bff9c1","observation_id":"56e971bf-0b8b-4923-a3ac-5d1367843215","resolution":{"observed_at":"2026-07-01T00:25:09.286031Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:4d6bfb86df722a580f745ed400982d7706b30815ee40d0879eba4ee2ce2dcf12","observation_id":"a0fa9cd0-9f37-4ef1-b4d9-0c24f3117128","resolution":{"observed_at":"2026-07-01T00:25:09.338688Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08377","last_updated":"2026-07-03T16:46:11Z","snapshot_observed_at":"2026-08-04T10:49:46.339959Z","submitted_at":"2025-10-09T16:01:30Z","title":"UniVideo: Unified Understanding, Generation, and Editing for Videos","version":4},"cited_work":{"arxiv_id":"2510.08377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.08377","snapshot_observed_at":"2026-07-07T03:17:13.018030Z","title":"Univideo: Unified understanding, generation, and editing for videos","venue":null,"work_id":"c6b943b5-97f1-4afc-bf4e-16761043ecac","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2510.08377","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:c045aeec05480fb4cbe49ba94846f133366216a45da2420c6facc0143750a195","observation_id":"8b34f157-24f5-4478-a288-0f55552c113f","resolution":{"observed_at":"2026-07-07T03:17:13.018030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:162f651c23d73f94b07122b9f958708d808e88c16055be7d727df5157c2928ae","observation_id":"a9579c60-9668-48c0-b4a7-66cbc4e9aa29","resolution":{"observed_at":"2026-07-01T00:25:09.391588Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:53:32.092508Z","title":"Exploring video quality assessment on user generated contents from aesthetic and technical perspectives","venue":null,"work_id":"ea1ba260-7e40-4aa4-9102-0373d1c2aeb1","year":2023},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:756d747d1f0cec46501c6ef7687371ab99b3b418dd6cd8d6247c13d32df3f4e3","observation_id":"1edc8795-bd91-495d-b40b-64ad1052c169","resolution":{"observed_at":"2026-07-07T08:53:32.093772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:53:32.090627Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis, 2023 b","venue":null,"work_id":"e2e6f863-c40a-436e-94b5-703e711f2162","year":2023},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:5c6d48d59e17ac56cf7eb60ea47a15a065c60271fcb7ffda4423d5da7274c909","observation_id":"ea016000-0798-422e-b844-7b6386fa2705","resolution":{"observed_at":"2026-07-07T08:53:32.091945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.02933","doi":"10.48550/arxiv.2512.02933","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoRR , volume =","venue":"ArXiv.org","work_id":"a99c19f6-9776-4fd6-ad91-9f6268407f2e","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:090eb0e525e2c43d4f073b3be1ebc56980b599846782c06ac218efdda41f2be6","observation_id":"53fc90a3-6bbb-436d-b1fe-fc58fe2d91f4","resolution":{"observed_at":"2026-07-01T00:25:09.357918Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:15.076066+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:15.076066+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04216","last_updated":"2025-06-04T17:57:43Z","snapshot_observed_at":"2026-07-06T21:36:45.605379Z","submitted_at":"2025-06-04T17:57:43Z","title":"UNIC: Unified In-Context Video Editing","version":1},"cited_work":{"arxiv_id":"2506.04216","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04216","snapshot_observed_at":"2026-07-04T16:29:56.632377Z","title":"Unic: Unified in-context video editing","venue":null,"work_id":"309245ca-25dd-4058-af47-e373bcbb1fdf","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2506.04216","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:6fae7b6497df018cf7e05580b421b2f1eaee481e2e3914c1138b6315ca288bcc","observation_id":"d24717c6-052e-4e5b-be59-72508b42d172","resolution":{"observed_at":"2026-07-01T00:25:09.385385Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:53:32.110547Z","title":"Magic 1-for-1: Generating one minute video clips within one minute","venue":null,"work_id":"fee6f413-e0da-48ce-abca-a9aa7b4e2bb7","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:0dea1135b76c96a6ffcd4e2a1d408f6e91f0e1770bfc910ac6ce32ac0eb584ad","observation_id":"aa06ab5f-c996-4437-b213-36e7d3a57d7a","resolution":{"observed_at":"2026-07-07T08:53:32.113014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:53:32.106863Z","title":"Veggie: Instructional editing and reasoning video concepts with grounded generation","venue":null,"work_id":"66424262-e4c6-4a97-ac1b-71d124d578f3","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:c6e750d781283d494e8c28ad650dd42128afe79708b841e7a8377fa8831385f0","observation_id":"81cebba6-2977-4b7b-b472-0c5dd7079c21","resolution":{"observed_at":"2026-07-07T08:53:32.108111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:53:32.096270Z","title":"Spargeattention: Accurate and training-free sparse attention accelerating any model inference","venue":null,"work_id":"2f70f92a-6ba5-4f44-843a-0074879df85c","year":null},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:ee6554ce5ab55afdcceab3da99fa798f1738a0dcc203821e709ec5556c182251","observation_id":"94d49cc1-c5b3-4f82-bdfe-ffde24ca3e27","resolution":{"observed_at":"2026-07-07T08:53:32.098406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:53:32.094366Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"7eb71718-f1c9-4e9a-90e8-5dad3a10eb4d","year":2023},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:62e87515f7ab68065c95d351f9115c9495881fc48e31d99f029cdd69affc68be","observation_id":"2407c554-2088-492b-ae59-1814d2f66b7a","resolution":{"observed_at":"2026-07-07T08:53:32.095655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.13389","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:07:44.526111Z","title":"VSA: Faster Video Diffusion with Trainable Sparse Attention, October 2025","venue":null,"work_id":"35a93b7b-fb25-4254-b014-f48bb199bfee","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:65103818376d474217deb5f42b5f0904c874b58090196b3a3abcb19827a5441c","observation_id":"792e5b47-e056-45a0-9e9b-a12293f0b661","resolution":{"observed_at":"2026-07-01T00:25:09.389051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04507","last_updated":"2025-06-04T23:21:39Z","snapshot_observed_at":"2026-08-05T18:16:36.053313Z","submitted_at":"2025-02-06T21:17:09Z","title":"Fast Video Generation with Sliding Tile Attention","version":3},"cited_work":{"arxiv_id":"2502.04507","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.04507","snapshot_observed_at":"2026-07-11T01:07:44.493549Z","title":"Spargeattn: Accurate sparse attention accelerat- ing any model inference","venue":"cs.CV","work_id":"c53350cf-72d0-42b0-af6c-8d19e35404e8","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2502.04507","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:1fbdc56b0ae9a8cb919c31798efb3e81294fc53a20718693d86b1ba84b9ad40d","observation_id":"7d6f13af-ced9-44a7-89e0-98e50ee875ce","resolution":{"observed_at":"2026-07-01T00:25:09.398258Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:53:32.102535Z","title":"Avid: Any-length video inpainting with diffusion model","venue":null,"work_id":"8ad21544-a098-4680-9ffb-7d0ac445ac55","year":2024},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:74c37c829c417c5aa955abc51c0f39e39b84c160ef6c5d6aed7b29734992e961","observation_id":"0931e6ac-ab61-4838-9fbd-c2fa969c19b7","resolution":{"observed_at":"2026-07-07T08:53:32.103738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.17650","doi":"10.48550/arxiv.2512.17650","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Region-constraint in-context generation for instructional video editing","venue":"arXiv (Cornell University)","work_id":"aa29ba4d-eb86-4d5c-b37d-8332f9137616","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:ee39a59cf9fe7844627615b2728cc2373789f9416cce2d0c77b6e361f2cb0b25","observation_id":"e97bc73c-0d1c-4682-bcd7-5cb9fbefee3c","resolution":{"observed_at":"2026-07-01T00:25:09.312641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:16.657407+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:16.657407+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24873","last_updated":"2025-05-30T17:59:45Z","snapshot_observed_at":"2026-07-06T21:33:50.814913Z","submitted_at":"2025-05-30T17:59:45Z","title":"MiniMax-Remover: Taming Bad Noise Helps Video Object Removal","version":1},"cited_work":{"arxiv_id":"2505.24873","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24873","snapshot_observed_at":"2026-07-02T02:16:26.810645Z","title":"arXiv preprint arXiv:2505.24873 , year=","venue":null,"work_id":"dec9d560-3598-49d7-804a-99efdf9eba09","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2505.24873","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:e4168fc23b13cdd11a3085429ddf034992d3ef74d146d7cf97e8018afb262a75","observation_id":"86a22e7e-fb2a-4a74-964b-e7fb9974e417","resolution":{"observed_at":"2026-07-01T00:25:09.305580Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06734","last_updated":"2025-03-12T07:47:48Z","snapshot_observed_at":"2026-07-06T20:34:11.407726Z","submitted_at":"2025-02-10T17:58:22Z","title":"Se\\~norita-2M: A High-Quality Instruction-based Dataset for General Video Editing by Video Specialists","version":3},"cited_work":{"arxiv_id":"2502.06734","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06734","snapshot_observed_at":"2026-07-01T07:55:30.838800Z","title":"A golden retrieverwearing a red harness is walking slowly with its nose close to the dry, leaf-covered ground in a fenced yard next to a bush and a road in the background","venue":null,"work_id":"253001b7-ac44-4784-9ad1-3b9b33928ca7","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"cited_paper":"/paper/2502.06734","citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:f41f38d21de071d3891b26cfd06cb8f464d7053bd86d71544bf5f253357533be","observation_id":"424be639-87c3-4e15-9fcd-e89a3e71a1be","resolution":{"observed_at":"2026-07-01T00:25:09.361619Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T08:53:32.125979Z","title":"Cococo: Improving text-guided video inpainting for better consistency, controllability and compatibility","venue":null,"work_id":"db492d8d-8ddc-4a34-8284-c474f0778c4b","year":2025},"citing_paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-07-01T00:24:30.573122Z"},"links":{"citing_paper":"/paper/2605.04569"},"observation_digest":"sha256:094e54dea5881b72ac8115d7b0d3ec4e7159532066eed9a7bd7daed736039818","observation_id":"1bab4b7f-52f1-436c-99a3-8210d68cb8ac","resolution":{"observed_at":"2026-07-07T08:53:32.127375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.04569","last_updated":"2026-05-28T14:50:27Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T07:15:29Z","title":"LIVEditor-14B: Lightning Unified Video Editing via In-Context Sparse Attention"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":11,"parse_uncertain":0,"unresolved":2,"verified_exact":28,"verified_fuzzy":20},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2605.04569."}