{"as_of":"2026-08-08T12:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:566b5394e8622ada8c7438c36b7dbb9b77d08bb3b959942b2dad15d927470514","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T18:55:21.867598Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.04472/citation-record","integrity":"/paper/2607.04472/integrity","json":"/paper/2607.04472/citation-record.json","paper":"/paper/2607.04472"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2025.Drifting A way from Truth: GenAI-Driven News Diversity Challenges LVLM- Based Misinformation Detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:5489bc2671c9568a297388056360c5967c657f7f368e598748c7c1f89f991820","observation_id":"33d20f8d-bbea-4610-80a3-5d3d38e313a6","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2025.Zooming In on Fakes: A Novel Dataset for Localized AI- Generated Image Detection with Forgery Amplification Approach","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:7d25955f90b28782808211d510117631378c2f5b87941a63d46dd6e3d81b5892","observation_id":"c3e63054-ec9b-422c-912f-4caf3af4b213","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.335681","doi":"10.1109/tpami.2024.3356814","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"IEEE Transactions on Pattern Analysis and Machine Intelligence","work_id":"6ee3cc77-60b8-4622-aae4-2f17a937f44f","year":2024},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:1a809737a2a6e7314719b115d6930c68d9fea0bcabd82e47b0ef8b11f79bc4e7","observation_id":"bb644b91-cb7c-41b8-b9e1-be37bca4f3f0","resolution":{"observed_at":"2026-07-11T18:58:11.230423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-12T07:49:25.448858+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T07:49:25.448858+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2015.Going deeper with convolutions","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:0ef4930ead1fc778190ffe2282014d9518cb9f5576c9c98b32d265067319e075","observation_id":"87ab28e0-b3e6-4d3d-99db-88a588ca0534","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2018.Cascade R-CNN: Delving into High Quality Object Detection","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:ef9a6a5eabd1005618d66837323094eae6e62e27a23b61717856cd788f0458de","observation_id":"3adb4922-09c0-479b-987d-2ce47a1f995b","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2022.Do You Really Mean That? Content Driven Audio-Visual Deepfake Dataset and Multimodal Method for Temporal Forgery Localization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:8e6561fc19aeecbe9a7f41460ececcb4c1f323e086d1942decf6ead31aec4712","observation_id":"f70e452c-64b6-4813-9ab2-fc3f2be61ab3","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2016.Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:e977da0efaf442ea702042c2c85ef1de2ff294b4f79e76fca5527802ec86cd31","observation_id":"e9c224e1-a57e-4d82-ad7c-75e6859257c0","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"Rojas, Ali Thabet, Bernard Ghanem","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:153f2be623c6b7683e000a0ef80f3f15c688a0e572be5e316ecb993fca6e28e0","observation_id":"c46fd08f-133a-4261-9db6-5a34feb485fc","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00656","last_updated":"2019-05-22T15:06:39Z","snapshot_observed_at":"2026-07-06T07:12:10.424336Z","submitted_at":"2018-11-01T22:13:55Z","title":"Exposing DeepFake Videos By Detecting Face Warping Artifacts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00656","snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2019.Exposing DeepFake Videos By Detecting Face Warping Artifacts","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"cited_paper":"/paper/1811.00656","citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:32f76917b0919a29f746602e04bc2af026ecd04da2e86cc2c008d045b82c45eb","observation_id":"d68ba9a9-4716-4ce8-9efe-1c29659c2906","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05856","last_updated":"2019-09-05T17:59:09Z","snapshot_observed_at":"2026-07-06T08:00:11.162659Z","submitted_at":"2019-06-13T17:59:02Z","title":"Detecting Photoshopped Faces by Scripting Photoshop","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05856","snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"cited_paper":"/paper/1906.05856","citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:32bfaed69dedeb6d7586bfb17b9e782478c9f40295e63ef32c4c25277175e43e","observation_id":"be15f5d4-b99e-47c9-86aa-fa498afe596b","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2020.298866","doi":"10.1109/access.2020.2988660","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2020.DeepFake Detection via Facial Landmark Analysis","venue":"IEEE Access","work_id":"92fe3ea2-c940-4a1f-86ca-0ab44a843114","year":2020},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:01b5c970d02609740fd31f8a3b7deecd53930956856c1d65df6ca44051d8da05","observation_id":"12cf2aef-8320-4950-983a-254336ecfe52","resolution":{"observed_at":"2026-07-11T18:58:11.332483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-12T07:49:26.702434+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T07:49:26.702434+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2020.FakeCatcher: Detection of Syn- thetic Portrait Videos using Biological Signals","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:38551888e39ef990f17e61af0ce7aebf4418a10a2d2439922d62379e65da0c49","observation_id":"6930d8a9-9a23-4c8f-aa20-1ddab8330d75","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2019.FaceForensics++: Learning to Detect Manipulated Facial Images","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:730012d1b519275875ed4a3b0158ccc6703cdf2376678bc2a00258cd80a09967","observation_id":"dddb188e-5706-4a78-b528-084fc20b811d","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/wifs","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:58:11.338242Z","title":"2018.MesoNet: a Compact Facial Video Forgery Detection Network","venue":null,"work_id":"d6bc979f-2e86-4157-ab85-4c42bf9de3a4","year":2018},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:164700edf5cfe1cde09b37a825bf06572051150d40aa861c80dd4333daf02848","observation_id":"b0c6b79d-de08-4416-baee-46078164b3be","resolution":{"observed_at":"2026-07-11T18:58:11.340052Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2021.311700","doi":"10.1109/tkde.2021.3117003","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2023.Dis- criminative Feature Mining Based on Frequency Information and Metric Learning for Face Forgery Detection","venue":"IEEE Transactions on Knowledge and Data Engineering","work_id":"6d71c83a-9e18-4221-81c9-3c936b7c053c","year":2023},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:1b9777013bb72dbd007fde9ff0d37e15fbd047e274d41d1049984c19131dc046","observation_id":"6d57ef51-6bcc-4c49-a051-13981d8aa660","resolution":{"observed_at":"2026-07-11T18:58:11.216298Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-12T07:49:27.445473+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T07:49:27.445473+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-19830-4_27","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2022.Adaptive Face Forgery Detection in Cross Domain","venue":"Lecture notes in computer science","work_id":"41903ee9-6a70-40fe-9a94-7ac318da0f35","year":2022},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:54ad98e0345babb9570930d8c37ef8d60dc273a36c8c37eef03d901852456484","observation_id":"b519d600-af5f-4508-a642-853e578bd6ca","resolution":{"observed_at":"2026-07-11T18:58:11.330101Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-12T07:49:27.764092+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T07:49:27.764092+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2021.Learning Self-Consistency for Deepfake Detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:ee128a61ea60687d42f665ffb073f87d61340276c7c1c3ee872f7bf86406d9de","observation_id":"88f8aafe-f030-4286-9b2e-30edb6810dd5","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.319361","doi":"10.1109/tpami.2022.3193611","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2023.Deep Learning-Based Action Detection in Untrimmed Videos: A Survey","venue":"IEEE Transactions on Pattern Analysis and Machine Intelligence","work_id":"8a002635-1a4f-4486-ba04-86c358acbe46","year":2023},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:704bf12433ec2f8edcded54e9faa25a5a9e1d2a5fadf5c08b293b90f87e5940e","observation_id":"3bcae84b-aa1a-44ba-99bd-1c0009ce260d","resolution":{"observed_at":"2026-07-11T18:58:11.282948Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-12T07:49:28.061003+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T07:49:28.061003+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2023.PivoTAL: Prior-Driven Supervision for Weakly- Supervised Temporal Action Localization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:a99ad21f43845b947ea67ec49e54b97272c943bc866382832560f937b28f5b7a","observation_id":"788e5cd4-4d47-4a4b-8f99-8d9bbc2cb28f","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2024.Blind and Low Vision Individuals’ Detec- tion of Audio Deepfakes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:0d5fa867aab7ab16935260721b2570a0ae7c657b3add614f734c81cadd36b6dd","observation_id":"6e231910-19e1-4ec5-bb16-7f17d12630d4","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:392e908319c03228ea65a5fbc86909797510bfe1910be265a52824390825f533","observation_id":"021dbd0e-3cd1-48c3-aba5-5d65fb18fd58","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2021.An Image Is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:653cf50a2161da365d1abc38a0fa29bb2e37d6ec3facb895d786c69ec07cd846","observation_id":"39ae174d-d740-40ec-924a-d91c2e544339","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2024.End-to- End Temporal Action Detection with 1B Parameters Across 1000 Frames","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:f5e70c52c6a08c78e998ccfb236e946c1be9791871879e0e0f00d08c6fb5223f","observation_id":"0d3165fc-7253-4019-9478-8af76b40d921","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2021.BYOL for Audio: Self-Supervised Learning for General-Purpose Audio Representation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:3d57cf4e866f9c62ef2a4df8ede23f1c977d79300f719d8ac50fe6cca5a53ab5","observation_id":"35667870-73d3-48a3-b0f0-1da29570bdf0","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"Weinberger","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:0e3648ff58e7e50700b5cb503ed1113ecf99c5a53140595addb9ae4b9a40e837","observation_id":"9dd1b3d6-814c-4489-b11e-7c4b468d898a","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2021.Cross- Attentional Audio-Visual Fusion for Weakly-Supervised Action Localization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:29df0508c5a2c591eddb41226c046854be6242eb13703bfead30aead8649c100","observation_id":"88c41a1e-67dc-4cba-bcf8-936df28417e6","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2024.MLCA-A VSR: Multi-Layer Cross Attention Fusion Based Audio-Visual Speech Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:ea3e0867e2f7e5dcf85afde32e52a03f8312ae91c17076d46001b685071ef842","observation_id":"ebfa1847-6807-4a3a-9bae-08b53016159a","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4171.341370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:58:11.258875Z","title":null,"venue":null,"work_id":"8b8a4fba-1d3e-44de-b044-6268427a25b6","year":2020},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:e17a03d2d60db6ce8a1d53b11c18091b945e7c8a0bea0d12d11cdac9d4c21416","observation_id":"15bf82fb-ac2c-4377-acf5-ef1a6ac7d2dc","resolution":{"observed_at":"2026-07-11T18:58:11.261026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.08540","last_updated":"2021-01-28T12:14:19Z","snapshot_observed_at":"2026-07-06T10:34:19.340163Z","submitted_at":"2021-01-21T10:42:48Z","title":"Activity Graph Transformer for Temporal Action Localization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.08540","snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2021.Activity Graph Transformer for Temporal Action Localization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"cited_paper":"/paper/2101.08540","citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:07692fbc26876b95d6d5dcad5bd794f0982bc848ef451eeeeb9b970bf42a49eb","observation_id":"a93729f1-c023-4fb0-af58-a81d251471e6","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2019.BMN: Boundary- Matching Network for Temporal Action Proposal Generation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:5e85e1021f7082e864bab2ea96b56df16ae32e3ba446e74e1995c6212461c489","observation_id":"a4690baf-f505-454d-9227-1485eb4a8dbb","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.14118","last_updated":"2021-10-17T17:41:25Z","snapshot_observed_at":"2026-07-06T11:23:26.988614Z","submitted_at":"2021-06-27T00:49:02Z","title":"Hear Me Out: Fusional Approaches for Audio Augmented Temporal Action Localization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.14118","snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2022.Hear Me Out: Fusional Approaches for Audio Augmented Temporal Action Localization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"cited_paper":"/paper/2106.14118","citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:51ce1390b0875345aa34a273068934b9154bb0ab3fd9a0902a4252b51620af63","observation_id":"e41b3593-35a3-4b72-a444-6de7b14357d7","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2021.SOFT: Softmax-free Transformer with Linear Complexity.https://proceedings.neurips.cc/paper_files/paper/2021/file/ b1d10e7bafa4421218a51b1e1f1b0ba2-Paper.pdf","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:d03fefd34290b4467205943974aed4ff3f4a22cec3966b54403e3ed0ff0d79d8","observation_id":"7ab3e9d9-8097-49a8-8939-c78f6e2d82fd","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-19772-7_29","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2022.ActionFormer: Localizing Moments of Actions with Transformers","venue":"Lecture notes in computer science","work_id":"1ffcb687-82ac-4b34-b0b0-238e3172e0d1","year":2022},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:c411bb20c5777bbdb08fb90205310c78cf87efef26ab9fe39c9f11620a6c8822","observation_id":"82796cb5-d708-49da-9a60-7d4d7b1fb03f","resolution":{"observed_at":"2026-07-11T18:58:11.235015Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-12T07:49:29.85834+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T07:49:29.85834+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2023.Ummaformer: A Universal Multimodal-Adaptive Transformer Framework for Temporal Forgery Localization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:4e5d2726af2af3cff37e86c3dddc54e039b288f03fc1b645e6b7edb802352b9b","observation_id":"9473a0fc-d8a2-45aa-a4e9-49fc6af0a029","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10193","last_updated":"2025-04-11T06:56:20Z","snapshot_observed_at":"2026-08-02T18:41:47.891481Z","submitted_at":"2024-11-15T13:47:33Z","title":"DiMoDif: Discourse Modality-information Differentiation for Audio-visual Deepfake Detection and Localization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10193","snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2024.DiModiF: Discourse Modality- Information Differentiation for Audio-Visual Deepfake Detection and Localization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"cited_paper":"/paper/2411.10193","citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:8fbd46c24888fa0c977d8abe356573bf9ddb8951e729faa784f367616261ac69","observation_id":"37442a88-3105-480f-9aa7-a64e3f0ae0ed","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2018.Mesonet: a compact facial video forgery detection network","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:a8d26ef4b0f665da19e6755868f5cae85f4caec506f5853cf9bd263cb52e7684","observation_id":"2e2f0860-e15e-4a3e-a80d-c0b22a3616fd","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.103818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:58:11.240818Z","title":"2023.Glitch in the matrix: A large scale benchmark for content driven audio-visual forgery detection and localization","venue":null,"work_id":"33335269-d4cf-43ca-a958-20e5329bc88e","year":2023},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:a34b466b2b131ac0a5803ed57e3614f07cf22db4ca7e910c58533485210a595e","observation_id":"ed8c428b-127a-4ea4-bc89-1141ab7f9c61","resolution":{"observed_at":"2026-07-11T18:58:11.243035Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2023.Tridet: Temporal Action Detection with Relative Boundary Modeling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:f3b5de4ba517dabc40180f466cc8fdcae806534b24d61a68d9195d181ab7664d","observation_id":"6e393692-de00-4337-af65-61fa7b6bfaff","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"Zhang et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:b3b648cd255775f26187fd84d18bb7fbda912f7ec29ffd94e988aa58af26b258","observation_id":"ebbebc9d-117b-4eb9-a4c6-c760c820041b","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2017.Attention Is All You Need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:316187a64617817ac85119550e9eb40b340453026a8a7efbb9ca7f24b624074b","observation_id":"fff92487-6a1c-45d4-a746-5c07a06c878e","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2024.MetaFormer Baselines for Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:9e169d3f3698ee638fde28af12048df2d2f8fdeee79b0e5e046e299f1d578dce","observation_id":"76151fdd-2049-495f-98a8-c3618ab35f7d","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2020.Distance-IoU Loss: Faster and Better Learning for Bounding Box Regression","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:90e93a7d446380f7e26e731170b443def914228bbc11e1fc594b5064a990bca3","observation_id":"3f5ba93c-7d89-4714-97c0-9c13fc1f9bbf","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2017.Focal Loss for Dense Object Detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:13e6f409e2c47d31a9277e282210b9d1367cb51a91d14e212fcac7c074898a8b","observation_id":"5c75c3d5-4813-4835-835c-87eaff1c070a","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2025.Face Forgery Video Detection via Temporal Forgery Cue Unraveling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:fa3e2e5bd07405be14549ec92fd6cfd432adc5ec44ddd2af7c2a762604b1e606","observation_id":"8189c48c-bac5-432c-9517-41d9982a4231","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2024.A VFF: Audio-Visual Feature Fusion for Video Deepfake Detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:5d6d5f7bc2e1180e682bb4384bb941f9d6d4fac85f407fe668e81a89c638d412","observation_id":"6075bbb9-e5f9-460c-b486-5a13bf6c055f","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2024.Delocate: Detection and Localization for Deepfake Videos with Randomly-Located Tampered Traces","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:c852032c0f1879f9cd5c51b79ee591bd6d77135a96801ea88622f2a3f5fd2111","observation_id":"9664f815-11c6-4108-9e80-1fb5160e6ec3","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.359596","doi":"10.1109/tdsc.2025.3595960","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.Trusted Video Inpainting Localization via Deep Attentive Noise Learning","venue":"IEEE Transactions on Dependable and Secure Computing","work_id":"a82ee138-cf15-45dd-b03b-c1c598c09d02","year":2025},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:e161b0776c0b7f8af951a292ab0bb4cb8c768c49b1a808a4f6a64638deaa526c","observation_id":"9b92cbf2-f075-4e26-8eb2-d496aa908954","resolution":{"observed_at":"2026-07-11T18:58:11.254250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-12T07:49:32.117484+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T07:49:32.117484+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2025.Bridge the Gap: From Weak to Full Supervision for Temporal Action Localization with PseudoFormer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:eddb3bc344664341a22219560a3330f31b1668fd016de7c9536d9a47dc3941a9","observation_id":"ec8d9b4d-aea8-44e9-8c94-9bd53255974f","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:ffa666fa10331ac8576175c792fb13c49efff2d65954a8d60df51f86a60ea704","observation_id":"d9cef25f-7d7f-4a6c-b001-ba53856cd170","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2024.SafeEar: Content Privacy-Preserving Audio Deepfake Detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:0fadd5000ab59636cd8d01758790f7446366b2f7bf5e8d9b97b4d519b5942f14","observation_id":"a3afda54-d727-4e6f-a610-81d334a4b627","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2022.Localizing Fake Segments in Speech","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:9bc85731421c8137b710968f67f59d823c11be5f1e4ccf1966f712e72f8fc065","observation_id":"b2adb45a-2029-4eec-9dfa-dc971d4f2625","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-20062-","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:58:11.222512Z","title":"2022.Proposal-Free Temporal Action Detection via Global Segmentation Mask Learning","venue":null,"work_id":"cbdfcaac-a4c2-412b-9d9d-02fc8f71df6e","year":2022},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:1057f514a941290485bd037abb93f063e62b6af980e8da6c39fb8bde1aec2768","observation_id":"80e034b7-fa8b-4b7c-8c1f-d8781d5a88bb","resolution":{"observed_at":"2026-07-11T18:58:11.224232Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:55:21.867598Z","title":"2022.DCAN: Improving Temporal Action Detection via Dual Context Aggregation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:5527d4f059f3f47123cfb0ed6aa470a027d9c31019bd55e83d638d0a5859afc7","observation_id":"bef61c61-5bde-41ab-b8ab-445df0dde0c6","resolution":{"observed_at":"2026-07-11T18:55:21.867598Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4647.368079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T18:58:11.233335Z","title":"2024.A V-Deepfake1M: A Large-Scale LLM-Driven Audio-Visual Deepfake Dataset","venue":null,"work_id":"cb23eeb9-a24d-430f-82d1-6cf8d89237a4","year":2024},"citing_paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-11T18:55:21.867598Z"},"links":{"citing_paper":"/paper/2607.04472"},"observation_digest":"sha256:7110d46d3e8d363f824d622f7961fa0ccd82cbe5cea908edbc84b3a376a88343","observation_id":"d0979a33-24b1-430b-a11f-7b8ed3c479ce","resolution":{"observed_at":"2026-07-11T18:58:11.236002Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.04472","last_updated":"2026-07-05T19:33:21Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T13:58:28.438763Z","submitted_at":"2026-07-05T19:33:21Z","title":"EVAS: Efficient Multimodal Temporal Forgery Localization via Audio-Visual Synergy and Steered Boundary Calibration"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":9,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":10,"verified_fuzzy":0},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2607.04472."}