{"as_of":"2026-08-05T03:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:31d398d5cfa71d14925cefdd4de9c39983437dff017fe0e8be4aa057423c82c2","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T11:04:49.366127Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.03168/citation-record","integrity":"/paper/2606.03168/integrity","json":"/paper/2606.03168/citation-record.json","paper":"/paper/2606.03168"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:04:49.366127Z","title":"Insvie-1m: Effective instruction-based video editing with elaborate dataset construction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:62971289a356a60361b157854d16c358d4f1f71b0c1245ccd7042ba35787792b","observation_id":"7eeccabf-dd94-47ca-8a6f-ab26a3f47d90","resolution":{"observed_at":"2026-06-28T11:04:49.366127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.07826","doi":"10.48550/arxiv.2512.07826","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2512.07826 , year=","venue":"arXiv (Cornell University)","work_id":"c4b3187b-7b77-43e4-a313-26d23620d5aa","year":2025},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:1aff7ef3ae1a10fdca35a456b7d84281159d697641d2677b840e445dfcadbaf8","observation_id":"18a0ee24-8692-4f78-8519-c5aa8200a789","resolution":{"observed_at":"2026-07-02T02:16:26.743190Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:20.91186+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:20.91186+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.15742","doi":"10.48550/arxiv.2510.15742","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2510.15742 , year=","venue":"ArXiv.org","work_id":"4db310ce-4ba1-4e8d-93a6-90134f0ff4e8","year":2025},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:44a0b0f01fec41bf659d37f69ca466de185bb8d14d71f5ce665bfccfc54490ed","observation_id":"f1e7ddff-77f5-44a3-9b6f-c9a8c5c9d552","resolution":{"observed_at":"2026-07-02T02:16:26.745870Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T00:53:15.826948+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T00:53:15.826948+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20782","last_updated":"2025-03-26T17:59:04Z","snapshot_observed_at":"2026-07-06T20:59:09.299613Z","submitted_at":"2025-03-26T17:59:04Z","title":"Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising","version":1},"cited_work":{"arxiv_id":"2503.20782","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.20782","snapshot_observed_at":"2026-07-02T02:16:26.762455Z","title":"Zero-shot audio-visual editing via cross- modal delta denoising","venue":null,"work_id":"aa490335-4ba9-4329-b422-0fa6d5d19e9e","year":2025},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"cited_paper":"/paper/2503.20782","citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:914706a5552ff5f0fd77b63239d5e054f029b3b1f42e3a781de581ae7a87ff28","observation_id":"5f227e3c-16a9-46de-8416-4b5504f19ecd","resolution":{"observed_at":"2026-07-02T02:16:26.764211Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:04:49.366127Z","title":"Av-edit: Multimodal generative sound effect editing via audio-visual semantic joint control","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:03d86670591bcc27269cb47750e6c0286de73d032f2c3eb9bd6a2f272e6a26ff","observation_id":"512d2ac6-b1bb-4edd-839e-0009085e3bd9","resolution":{"observed_at":"2026-06-28T11:04:49.366127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.10571","last_updated":"2026-05-02T11:27:08Z","snapshot_observed_at":"2026-07-31T11:34:00.884185Z","submitted_at":"2025-12-11T11:58:53Z","title":"AVI-Edit: Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner","version":4},"cited_work":{"arxiv_id":"2512.10571","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.10571","snapshot_observed_at":"2026-07-02T02:16:26.757619Z","title":"AVI-Edit: Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner","venue":"cs.CV","work_id":"6062d67f-7d78-4442-bd2e-c93250b0bbd4","year":2025},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"cited_paper":"/paper/2512.10571","citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:b0d898333f3fb11793f038c6890aacde855bb5bc60b3e97e3df3192787da67b9","observation_id":"a2f8037c-11a4-4a69-a147-76ccc93413ca","resolution":{"observed_at":"2026-07-02T02:16:26.759100Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:04:49.366127Z","title":"Openhumanvid: A large-scale high-quality dataset for enhancing human-centric video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:00db4f3b6e9fea7afe976ac80482688938a980cdba9519cff3da9e980d4a100e","observation_id":"dbcecc2b-82a8-4dd0-b96a-955cd28af8cb","resolution":{"observed_at":"2026-06-28T11:04:49.366127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02629","last_updated":"2024-08-05T16:53:23Z","snapshot_observed_at":"2026-08-04T12:36:41.961169Z","submitted_at":"2024-08-05T16:53:23Z","title":"VidGen-1M: A Large-Scale Dataset for Text-to-video Generation","version":1},"cited_work":{"arxiv_id":"2408.02629","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.02629","snapshot_observed_at":"2026-07-09T07:56:04.692157Z","title":"VidGen-1M: A large-scale dataset for text-to-video generation","venue":"cs.CV","work_id":"08700961-671a-4226-a6a2-bfcbbc614b99","year":2024},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"cited_paper":"/paper/2408.02629","citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:62b3ba42f73fc29cfbb68481949f2b4b9684b0bb92709f0690d805cbfe819030","observation_id":"f9d4710d-4d57-43be-8766-893118d790e6","resolution":{"observed_at":"2026-07-02T02:16:26.776236Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.14368","last_updated":"2020-09-25T00:26:52Z","snapshot_observed_at":"2026-07-06T09:16:20.653589Z","submitted_at":"2020-04-29T17:46:54Z","title":"VGGSound: A Large-scale Audio-Visual Dataset","version":2},"cited_work":{"arxiv_id":"2004.14368","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2004.14368","snapshot_observed_at":"2026-07-02T02:16:26.807992Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"ec0730a0-d996-42cb-8991-5d3b152a9c2c","year":2004},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"cited_paper":"/paper/2004.14368","citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:2391c916bf4cae1b39eeeeaecefa86476dae08b33f289719d35037c37dc5294b","observation_id":"47715f08-aabd-4995-a65b-740a9166c7d4","resolution":{"observed_at":"2026-07-02T02:16:26.809374Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:04:49.366127Z","title":"Koala-36m: A large-scale video dataset improving consistency between fine-grained conditions and video content","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:2e83d3da0bd891fbf8385db96a424aac06b26707184c8d6fd37ec7a26966fe45","observation_id":"12d17b61-ec44-445a-9033-1d22877cfc74","resolution":{"observed_at":"2026-06-28T11:04:49.366127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2509.17765","doi":"10.48550/arxiv.2509.17765","metadata_source":"pith","pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-Omni Technical Report","venue":"cs.CL","work_id":"ae43e594-8bab-4471-b6af-92a300f6a048","year":2025},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:a1ff6800e2067a5d69ad457ce7411ad615990adf03959865fbc531581fc998fa","observation_id":"733d0f7c-5215-441b-bd55-a469b9bdf976","resolution":{"observed_at":"2026-07-02T02:16:26.750991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04702","last_updated":"2024-09-07T03:55:02Z","snapshot_observed_at":"2026-07-06T19:11:53.766902Z","submitted_at":"2024-09-07T03:55:02Z","title":"Mel-RoFormer for Vocal Separation and Vocal Melody Transcription","version":1},"cited_work":{"arxiv_id":"2409.04702","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.04702","snapshot_observed_at":"2026-07-02T02:16:26.771755Z","title":"Mel-roformer for vocal separation and vocal melody transcrip- tion.arXiv preprint arXiv:2409.04702, 2024","venue":null,"work_id":"b1f43b62-5f89-4eeb-8235-3c27a1bc9080","year":2024},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"cited_paper":"/paper/2409.04702","citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:3b1a0e73cfa3f707004ab78c28f486bfbe50fc505a05242260749085c094535f","observation_id":"5f42ee24-a374-4854-a97f-1a3ca3ed2eab","resolution":{"observed_at":"2026-07-02T02:16:26.773429Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23625","last_updated":"2025-05-29T16:31:45Z","snapshot_observed_at":"2026-08-01T22:01:38.490612Z","submitted_at":"2025-05-29T16:31:45Z","title":"ZeroSep: Separate Anything in Audio with Zero Training","version":1},"cited_work":{"arxiv_id":"2505.23625","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23625","snapshot_observed_at":"2026-07-02T02:16:26.752563Z","title":null,"venue":null,"work_id":"3c318e65-04e9-49a3-86b6-0285fe82c99d","year":null},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"cited_paper":"/paper/2505.23625","citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:aa1010cf141cbdf486699c343238fed4581a56bb444283a1a412d4b805451ef0","observation_id":"3a3124cf-28ce-4e0f-9763-d40762330633","resolution":{"observed_at":"2026-07-02T02:16:26.754001Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.18099","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T22:49:01.392868Z","title":"Ruijie Tao, Zexu Pan, Rohan Kumar Das, Xinyuan Qian, Mike Zheng Shou, and Haizhou Li","venue":null,"work_id":"5bd56fef-407a-4446-be8f-25022aa39c63","year":2025},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:416bd8239ec4d7b5332fd3bfa18f37789f1fde7de8772657bb5ff30b8e87d7d7","observation_id":"3b7734ac-fe9d-442d-a325-c37dfa514464","resolution":{"observed_at":"2026-07-02T02:16:26.732613Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:a7347065e1a04f7b9f2a02354bcf51088a2ae7e072f1dab03de32f8557f5491b","observation_id":"935d5965-417a-4a9e-b7d6-f02832cef876","resolution":{"observed_at":"2026-07-02T02:16:26.761375Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23951","last_updated":"2026-06-26T07:53:46Z","snapshot_observed_at":"2026-08-04T14:42:12.962842Z","submitted_at":"2025-09-28T16:14:10Z","title":"HunyuanImage 3.0 Technical Report","version":3},"cited_work":{"arxiv_id":"2509.23951","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.23951","snapshot_observed_at":"2026-07-04T16:59:57.981208Z","title":"HunyuanImage 3.0 Technical Report","venue":"cs.CV","work_id":"36511e33-8360-43dd-9407-dddf867c1d7c","year":2025},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"cited_paper":"/paper/2509.23951","citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:4c32cf4567c6720980216dea90b4cb2cd73d187ef174b08b3b1988d9590d0b47","observation_id":"80f263da-5825-4738-b7af-39bff0ff780e","resolution":{"observed_at":"2026-07-02T02:16:26.756423Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:68229598cc05e06668f9f1afb74e77973b454c622cb6999ac9c0d032cacce37d","observation_id":"9ac78d33-4697-4e05-8e13-51fc775aab86","resolution":{"observed_at":"2026-07-02T02:16:26.770215Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16314","last_updated":"2024-06-24T04:46:50Z","snapshot_observed_at":"2026-07-06T18:35:49.991098Z","submitted_at":"2024-06-24T04:46:50Z","title":"DreamVoice: Text-Guided Voice Conversion","version":1},"cited_work":{"arxiv_id":"2406.16314","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.16314","snapshot_observed_at":"2026-07-02T02:16:26.795917Z","title":"Dreamvoice: Text-guided voice conversion.arXiv preprint arXiv:2406.16314, 2024","venue":null,"work_id":"6de9bf76-0e48-477c-8de5-611433399b66","year":2024},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"cited_paper":"/paper/2406.16314","citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:0bd572ce2037e7e86917341f5aef050b60c70d19b40227cf3f1bf953214d055b","observation_id":"d655ff30-74f8-4484-96db-181507b2e4d5","resolution":{"observed_at":"2026-07-02T02:16:26.797282Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.01720","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T02:16:26.745758Z","title":"Ffp-300k: Scaling first-frame propagation for generalizable video editing.arXiv preprint arXiv:2601.01720, 2026","venue":null,"work_id":"f9711beb-c361-4cc7-829a-6a4fcfe8769b","year":2026},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:222c02e428f90840eb7e87c3b1bd4a414c2cb55580b410aee4a75402ff1803ea","observation_id":"965398af-e867-4dfa-9a4f-5e3aaec6a554","resolution":{"observed_at":"2026-07-02T02:16:26.747725Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16930","last_updated":"2025-08-23T07:30:18Z","snapshot_observed_at":"2026-07-06T22:17:02.502437Z","submitted_at":"2025-08-23T07:30:18Z","title":"HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation","version":1},"cited_work":{"arxiv_id":"2508.16930","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.16930","snapshot_observed_at":"2026-07-02T04:56:39.439125Z","title":"Hunyuanvideo-foley: Multimodal diffusion with representation alignment for high-fidelity foley audio generation","venue":null,"work_id":"c52cc69a-842a-4c11-873a-e3d9aaaeb3de","year":2025},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"cited_paper":"/paper/2508.16930","citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:6e7bdb6382e04f80da318139eceb65eff3b2b93985c4b9acfd465512af268fc1","observation_id":"aa346e1f-6b7a-4698-84f3-0395901c5310","resolution":{"observed_at":"2026-07-02T02:16:26.744449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24873","last_updated":"2025-05-30T17:59:45Z","snapshot_observed_at":"2026-07-06T21:33:50.814913Z","submitted_at":"2025-05-30T17:59:45Z","title":"MiniMax-Remover: Taming Bad Noise Helps Video Object Removal","version":1},"cited_work":{"arxiv_id":"2505.24873","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24873","snapshot_observed_at":"2026-07-02T02:16:26.810645Z","title":"arXiv preprint arXiv:2505.24873 , year=","venue":null,"work_id":"dec9d560-3598-49d7-804a-99efdf9eba09","year":2025},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"cited_paper":"/paper/2505.24873","citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:858107ee4f01215b3dcd1ad956f439173c82b34d08c7f8a00cb7b3f0db3061a4","observation_id":"806f97f2-d01d-4411-a459-559b7a892109","resolution":{"observed_at":"2026-07-02T02:16:26.812069Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":"2511.16719","doi":"10.48550/arxiv.2511.16719","metadata_source":"pith","pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 3: Segment Anything with Concepts","venue":"cs.CV","work_id":"4a72a006-2592-4554-aad0-a9c41a9f952d","year":2025},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:c62548020e8ac1dc3a4ba1722a5e9b2cf5b344c4ad5eb88b9c632f9dd675b437","observation_id":"2069844f-6987-4678-8437-c4648e3b40ad","resolution":{"observed_at":"2026-07-02T02:16:26.804202Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15621","last_updated":"2026-01-22T03:51:43Z","snapshot_observed_at":"2026-08-04T12:22:34.670840Z","submitted_at":"2026-01-22T03:51:43Z","title":"Qwen3-TTS Technical Report","version":1},"cited_work":{"arxiv_id":"2601.15621","doi":"10.48550/arxiv.2601.15621","metadata_source":"pith","pith_arxiv_id":"2601.15621","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-TTS Technical Report","venue":"cs.SD","work_id":"6e1ae3e6-2062-4e44-a140-5c75409032cd","year":2026},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"cited_paper":"/paper/2601.15621","citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:0f27d9f0f85dc59390e8338abfabc28ede69543015e95628bb458aad27eb6873","observation_id":"0c992d99-9660-4583-94db-41731bc63462","resolution":{"observed_at":"2026-07-02T02:16:26.741492Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:a037a18e003f2110962e9b24509782a850f79f55c5b74d553d92ec27e37a377f","observation_id":"ed43b2f1-d428-4817-bc4d-5b6c76f75484","resolution":{"observed_at":"2026-07-02T02:16:26.806856Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-07-06T20:05:55.982214Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":"2412.09262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-04T21:00:08.897097Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision","venue":null,"work_id":"58bec219-b581-4884-a7c0-51325341150e","year":2024},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:ecfaaa44d35fbb2ae70077e7f1c04f6906f946529b7f0d1aa56deb2cb198ff39","observation_id":"ec41fd86-9262-41f2-9019-b5c3cabf12bd","resolution":{"observed_at":"2026-07-02T02:16:26.791937Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09305","last_updated":"2024-09-14T05:03:18Z","snapshot_observed_at":"2026-07-06T19:15:17.200627Z","submitted_at":"2024-09-14T05:03:18Z","title":"The T05 System for The VoiceMOS Challenge 2024: Transfer Learning from Deep Image Classifier to Naturalness MOS Prediction of High-Quality Synthetic Speech","version":1},"cited_work":{"arxiv_id":"2409.09305","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.09305","snapshot_observed_at":"2026-07-03T23:19:02.920730Z","title":"The T05 System for the VoiceMOS Challenge 2024: Transfer Learning from Deep Image Classifier to Naturalness MOS Prediction of High-Quality Synthetic Speech","venue":null,"work_id":"b93d17ca-8b16-43c8-b050-16f3663f2fe7","year":2024},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"cited_paper":"/paper/2409.09305","citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:4c8b1dff0267bb05b51dfdd0eebcf559f4e612256269b09774e54da11f2c0acd","observation_id":"47ff6187-ee6a-405d-a300-ccca218c79d6","resolution":{"observed_at":"2026-07-02T02:16:26.789450Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.02175","last_updated":"2026-05-13T06:57:11Z","snapshot_observed_at":"2026-07-31T17:42:41.975872Z","submitted_at":"2026-03-02T18:46:28Z","title":"Kiwi-Edit: Versatile Video Editing via Instruction and Reference Guidance","version":4},"cited_work":{"arxiv_id":"2603.02175","doi":"10.48550/arxiv.2603.02175","metadata_source":"pith","pith_arxiv_id":"2603.02175","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kiwi-Edit: Versatile Video Editing via Instruction and Reference Guidance","venue":"cs.CV","work_id":"d0b46f0f-22ff-43a5-b80b-84efbd9e448d","year":2026},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"cited_paper":"/paper/2603.02175","citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:faa69abbbd0bdd3aaba4667a9e498a3616d7c92e9e77d12556cbd2fe5c333ba7","observation_id":"9c1beeb9-2b51-4a73-ab23-95bbac9f59d7","resolution":{"observed_at":"2026-07-02T02:16:26.783808Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.17187","doi":"10.48550/arxiv.2603.17187","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Metaclaw: Just talk–an agent that meta-learns and evolves in the wild","venue":"arXiv (Cornell University)","work_id":"118635c4-eee7-48da-9dfe-ffaf07704aa7","year":2026},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:63c460b836863311fdd7021f7a8bf90a1dcd2aeadaaa3b3149cb67b765ac9d98","observation_id":"6f9db44e-0142-48b3-96b7-56b4b8944e60","resolution":{"observed_at":"2026-07-02T02:16:26.778819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.328353","doi":"10.1109/tpami.2023.3283537","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2023 , keywords =","venue":"IEEE Transactions on Pattern Analysis and Machine Intelligence","work_id":"6ff1b617-cab7-45f5-bcd1-e2393d3937a0","year":2023},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:e802e1eae78d3cda8f1f793d4237bd35b0a347cb28a836105ca408a4201b210a","observation_id":"72ff8f0f-2504-47d9-a95b-02adaf134aa1","resolution":{"observed_at":"2026-06-28T11:12:00.839746Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:04:49.366127Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:2320e108cc71587140bf6e1d985a4b020956e22bdd8322e1812190da791a938a","observation_id":"1ae7171d-17c2-4077-88e4-8db78d3feb49","resolution":{"observed_at":"2026-06-28T11:04:49.366127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:04:49.366127Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:c7183e6efc99391384c74831f3d9fe16dc857ea35340da7b9fb544459a380389","observation_id":"9ccf29e2-36ea-42ba-a99e-cb35d05c7cee","resolution":{"observed_at":"2026-06-28T11:04:49.366127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.18822","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T16:38:39.577895Z","title":"arXiv preprint arXiv:2511.18822 (2025)","venue":null,"work_id":"1bcc412b-04bd-477a-87df-54e466aa8616","year":2025},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:1b66ea73efc2562251f2616e48c3af1cf3d1271b5dabd3276203ed2822785ab8","observation_id":"fc659e16-7cc5-4acd-963a-3e5a40732356","resolution":{"observed_at":"2026-07-02T02:16:26.786773Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":"2207.12598","doi":"10.1109/cvpr52733.2024.02494","metadata_source":"pith","pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Classifier-Free Diffusion Guidance","venue":"cs.LG","work_id":"acf2c588-c088-4a6c-938e-150ad7c666d7","year":2022},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:2b088f6d64ceddfdf4cac76726e67c86bf416cbe438e2beef667c762fac225e7","observation_id":"3fc6c7ef-5ca3-43f1-9db4-0b6139758611","resolution":{"observed_at":"2026-07-02T02:16:26.781353Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:04:49.366127Z","title":"Ragd: Regional-aware diffusion model for text-to-image generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:9f8e3815a7999a7b5493536007066c0e1b66df857454acbe48a8cc1408fb5f8e","observation_id":"0e6a18fc-fd70-4e50-a77b-975544d28f03","resolution":{"observed_at":"2026-06-28T11:04:49.366127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":"2011.13456","doi":"10.1088/1748-9326/aae98d","metadata_source":"pith","pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","venue":"cs.LG","work_id":"d9110e53-a5d4-4794-a4c5-a575e91c31ad","year":2020},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:0da06a774221edee43b3b07a939279ecdb3425377fca3b25f31f689a6c7002bb","observation_id":"c496c4b1-d363-43df-8fa6-283a2691de02","resolution":{"observed_at":"2026-07-02T02:16:26.794697Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12013","last_updated":"2026-05-12T12:01:35Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T12:01:35Z","title":"L2P: Unlocking Latent Potential for Pixel Generation","version":1},"cited_work":{"arxiv_id":"2605.12013","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12013","snapshot_observed_at":"2026-07-03T16:38:39.642117Z","title":"L2P: Unlocking Latent Potential for Pixel Generation","venue":"cs.CV","work_id":"c919bf94-3514-4e42-974d-ca1f501d987d","year":2026},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"cited_paper":"/paper/2605.12013","citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:b2f846abf1657a162f09d23ff9733efe0d2a87b854ad3c7515e86c26c9e698b1","observation_id":"c26f449c-96fa-42ca-bdec-25df508e6230","resolution":{"observed_at":"2026-07-02T02:16:26.799539Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":"2408.00714","doi":"10.1038/s41598-025-97590-3","metadata_source":"pith","pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 2: Segment Anything in Images and Videos","venue":"cs.CV","work_id":"acc13f66-d814-44f9-9688-375688bf2d4a","year":2024},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:3cbb5c87298cd3c94e33561bf0b4f4960852ea0792fd21c39469d54ebef06255","observation_id":"e6b72f66-a01c-4fde-9929-6efabc1cdd15","resolution":{"observed_at":"2026-07-02T02:16:26.766566Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T04:24:23.885301+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T11:04:49.366127Z","title":"Ivebench: Modern benchmark suite for instruction-guided video editing assessment","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:58407a31fb54538c8aa401eaacf0c37d1775b18b1b1ecaa830f8d04cb91d83fe","observation_id":"e63be31f-b2b5-4d49-b4cd-f47b0ab46695","resolution":{"observed_at":"2026-06-28T11:04:49.366127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6500.0599","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T02:16:26.800624Z","title":"hard to distinguish","venue":null,"work_id":"9266bbe5-c29d-4d29-b357-d0d212e92d8c","year":null},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:fa441109c7d77311fece903565ef3ec63f7f27f0d47d6e63fdb44f19f791cead","observation_id":"b2f06081-76d7-47ec-8aa8-c52e4c44a8d0","resolution":{"observed_at":"2026-07-02T02:16:26.801917Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":8,"verified_exact":27,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2606.03168."}