{"as_of":"2026-08-08T06:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:057582af4e238beba33dc42cd4c68544db02f6fea883efd01edb15593ba352d0","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:22:11.094770Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.22781/citation-record","integrity":"/paper/2507.22781/integrity","json":"/paper/2507.22781/citation-record.json","paper":"/paper/2507.22781"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-06T11:22:05.411665Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:05.411665Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:8d92acb249e01f98332541af01df5076e441ff3cd982ca374c7aee429a3a4139","observation_id":"effd9037-0481-4087-af1f-a8d58e086193","resolution":{"observed_at":"2026-08-06T11:22:05.411665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T11:22:05.477912Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:05.477912Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:ccadcb630a6956c9a5d81c183fb0a7daeb12c22c4d6dce82ffa1b99ce7ef6b30","observation_id":"0747430c-e929-4d4b-bce4-1dd373c9ef16","resolution":{"observed_at":"2026-08-06T11:22:05.477912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:05.573195Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:05.573195Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:f7a6dfbf6d9d406890de54dea786d55edff39a787e999079e6677818a06d5f0f","observation_id":"ad31c558-72e1-46b5-bcc5-adb8ac9b5e32","resolution":{"observed_at":"2026-08-06T11:22:05.573195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.473510Z","title":null,"venue":null,"work_id":"0a22e277-d833-4833-8f89-fbeab25bbb81","year":2025},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:05.641843Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:9bf80fa0c7c9a8ed5ce0be20da77d61207772dc1ee09faab87ee9c96b980b8cb","observation_id":"f2d51abc-683e-4a18-ba05-5ca05c79365d","resolution":{"observed_at":"2026-08-06T11:22:13.477087Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.463844Z","title":null,"venue":null,"work_id":"6ed16dd3-71da-48c2-b0c0-98bb4161e5eb","year":2024},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:05.745938Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:72214c04a3dbeffbe2e441a199f295df9904b3b51170364d9b7153f11185701d","observation_id":"ab54ee9f-25ef-417d-8411-9d7fae8c0eb0","resolution":{"observed_at":"2026-08-06T11:22:13.467168Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20579","last_updated":"2025-07-28T07:27:42Z","snapshot_observed_at":"2026-08-07T04:58:34.763057Z","submitted_at":"2025-07-28T07:27:42Z","title":"AV-Deepfake1M++: A Large-Scale Audio-Visual Deepfake Benchmark with Real-World Perturbations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20579","snapshot_observed_at":"2026-08-06T11:22:05.863936Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:05.863936Z"},"links":{"cited_paper":"/paper/2507.20579","citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:24bb41c736920fdd75092480424bf345ca15307dd77224c1dd63e77bb8993720","observation_id":"c85ce3f1-f6e2-463a-8fcd-c8df423c9f91","resolution":{"observed_at":"2026-08-06T11:22:05.863936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.452977Z","title":null,"venue":null,"work_id":"253168a4-e904-4ba5-b93f-37bbc4038dec","year":2022},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:05.896128Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:b0e938f0354e64489f9373e5c9a98cb4cd277608138863ab93cacdb75d6e9852","observation_id":"6e5fbcac-e2cb-42b6-9d64-27246ed549d7","resolution":{"observed_at":"2026-08-06T11:22:13.456470Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.440632Z","title":null,"venue":null,"work_id":"b7392c90-8adb-4a29-ae6b-06c97b2de4cc","year":2017},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:05.947834Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:ca120e267db39cd241c176481b48f9a110d65854d4db67490f0df1703e399e45","observation_id":"a5491269-5b38-4986-91db-026a580beefb","resolution":{"observed_at":"2026-08-06T11:22:13.445155Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.430015Z","title":null,"venue":null,"work_id":"93204c1d-4598-48c7-96ea-904a5361da2a","year":null},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:06.036307Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:02aa39d400bd465bfa8c92580028cd86ab345bda7722f7d1a9ac93f077811612","observation_id":"be9b7e5e-a7f2-4308-a71a-347824d9cc69","resolution":{"observed_at":"2026-08-06T11:22:13.433466Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07143","last_updated":"2020-08-10T13:50:24Z","snapshot_observed_at":"2026-08-07T15:21:18.262728Z","submitted_at":"2020-05-14T17:02:15Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07143","snapshot_observed_at":"2026-08-06T11:22:06.232168Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:06.232168Z"},"links":{"cited_paper":"/paper/2005.07143","citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:c815ffa2bc08cc97c4cd970456de529db1005beb78c55e926e71cb0f4bef8537","observation_id":"e1a4e95e-0f2c-42cc-bc94-d6fcf5b3ce6d","resolution":{"observed_at":"2026-08-06T11:22:06.232168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.410164Z","title":null,"venue":null,"work_id":"72da19b6-bcd4-4243-9958-3fb066bf8651","year":2020},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:06.325533Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:0f59fd3beb942301cff6085008b1fad93531922c7d1086493c9537e291a44384","observation_id":"b3ee7575-72e5-4b64-9a61-379af7054532","resolution":{"observed_at":"2026-08-06T11:22:13.413407Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.399227Z","title":null,"venue":null,"work_id":"1d0878ec-34a9-4f75-99f8-ccddd33540d9","year":2025},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:06.418755Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:5163fe9a073ebf699383c5d9ce6a94c4515f9552580789eac2148450b7f5019f","observation_id":"951a740e-9443-47d1-b60e-ca3cce531441","resolution":{"observed_at":"2026-08-06T11:22:13.402949Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.387670Z","title":null,"venue":null,"work_id":"47840f99-6662-4d2d-a151-4372bada9b3d","year":null},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:06.477914Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:b15ccd4485f83853d429ef6b2e681a3e0b105bfba1cadb313c590a67637165c8","observation_id":"83199327-1f1c-43ce-b2e5-83f959260212","resolution":{"observed_at":"2026-08-06T11:22:13.391508Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.367172Z","title":null,"venue":null,"work_id":"a21e7b82-c4e0-4ce6-baeb-fb637bc00b52","year":2019},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:06.662146Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:902c41ec1b3f6ba30483ab9e36a057e256aaa3488dd7642d75b0b76194d362f3","observation_id":"bc871ed8-fa1d-4bea-8be2-fe007dfce378","resolution":{"observed_at":"2026-08-06T11:22:13.370167Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.355930Z","title":null,"venue":null,"work_id":"10ad374f-f8c8-4f2f-a1b4-872dd080f718","year":null},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:06.770868Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:4a1acb2510fac26f72c029d2d6e153753e0eb8b5f057df5a529dcfda9a72ef8c","observation_id":"1ab97031-acef-4f9e-ad8d-c56aaaabeb64","resolution":{"observed_at":"2026-08-06T11:22:13.358812Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.343975Z","title":null,"venue":null,"work_id":"ade258d0-2e16-4840-8c12-36040082ccd5","year":null},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:06.990439Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:38c46e003ce5c08793a0ee047e2d8b554f8ac241bf01b050d112a69a1014081c","observation_id":"2b7a913f-8324-4b44-9b1e-1b9e3f5b7820","resolution":{"observed_at":"2026-08-06T11:22:13.347515Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.331964Z","title":null,"venue":null,"work_id":"d4474fdf-1eba-4038-9384-35f9bec161d1","year":2021},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:07.137170Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:7b3bc6e44b05d032fbdabebb9280bb17481ed54fdc8c62f8075835ead33a13d8","observation_id":"cd284ad0-8c6d-44a8-8089-e4fe71e5290b","resolution":{"observed_at":"2026-08-06T11:22:13.335767Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:07.192945Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:07.192945Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:bfe24caf8007220034bc79173e2fa74ec20459d9cdd62abadaed06269ecb86bc","observation_id":"9611d3b2-7769-4130-9ec5-359f6276a384","resolution":{"observed_at":"2026-08-06T11:22:07.192945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:07.239818Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:07.239818Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:e51ebe3eb4b2f0b9af12fe327dc491c3fa739bafd951469cac9c89b0c0111d18","observation_id":"ef17a6f6-5b3b-4eed-a1fd-b7145d65b926","resolution":{"observed_at":"2026-08-06T11:22:07.239818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.05080","last_updated":"2022-03-01T10:38:07Z","snapshot_observed_at":"2026-08-06T06:30:26.873321Z","submitted_at":"2021-08-11T07:49:36Z","title":"FakeAVCeleb: A Novel Audio-Video Multimodal Deepfake Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.05080","snapshot_observed_at":"2026-08-06T11:22:07.367992Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:07.367992Z"},"links":{"cited_paper":"/paper/2108.05080","citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:ae820f6d3c7b2898dd6ac3c47633a23ec7436d40a0fa6d6edf6dabf516ddfb36","observation_id":"4200f296-1d42-43ed-b819-ecd860d9a56a","resolution":{"observed_at":"2026-08-06T11:22:07.367992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:07.450675Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:07.450675Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:c77ad4fe706025bb5b33bd18513d33f9694cca57a25649dedd9d89e820499c1b","observation_id":"70d7e93e-960b-4341-aa21-9ae7c69c9739","resolution":{"observed_at":"2026-08-06T11:22:07.450675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T11:22:07.629431Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:07.629431Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:a873768daa63f5e243e97c8a12fb531b72879f5bb85507117a3f761bbd8e7cac","observation_id":"9e81d721-8450-46f8-8ee6-f1a21ce056e0","resolution":{"observed_at":"2026-08-06T11:22:07.629431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.301036Z","title":null,"venue":null,"work_id":"361eec48-ba49-4f8e-978f-e277eac05640","year":2020},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:07.745701Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:9cf5dfa0e21990cf2eb2ce904c3f1c3b71a6cab44125e183fc6370b491587042","observation_id":"9c729d69-5cf2-4e11-a5d6-6a17c1349d08","resolution":{"observed_at":"2026-08-06T11:22:13.305056Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.290403Z","title":null,"venue":null,"work_id":"7325379e-cbc6-4f89-b22c-639b8d7ed2a7","year":2022},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:07.841615Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:728430cde1dded9c4243a31f5dc87a5814c3030aead9a75e7e84aa4f6240f8ef","observation_id":"83e6d246-856a-459c-a113-a803222f8168","resolution":{"observed_at":"2026-08-06T11:22:13.293319Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:07.958818Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:07.958818Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:f0bc8674d4afa06c6d74e0de2d4ec853d36b9ba628fa35fae03ea4949db8fe0a","observation_id":"967b6b02-e4b3-42d3-82d9-8529ca70ce21","resolution":{"observed_at":"2026-08-06T11:22:07.958818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T11:22:08.150028Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:08.150028Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:f6e9361f93b3d98122b6d5413d6bd66c5e32215259ab1df8b177de3e708542c3","observation_id":"7a6f3d12-8ea7-4a62-a844-66cdb26152bb","resolution":{"observed_at":"2026-08-06T11:22:08.150028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3437880","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:11.705855Z","title":null,"venue":null,"work_id":"0075cf70-80da-41ad-a86f-093611c5ae40","year":2021},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:08.282021Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:d01a061dbd3c41a0d2ac0567503684ae4ca31975459add067679016399b0b0e2","observation_id":"e30bebd7-02f5-4476-921a-def0d6d8376b","resolution":{"observed_at":"2026-08-06T11:22:11.786336Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:08.369036Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:08.369036Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:b68f9dd82421b8c02daff792712256d01760fd9b7625983c2679fba44b2217e0","observation_id":"cb39c92b-bd58-4f6f-ad10-092f0a1893ef","resolution":{"observed_at":"2026-08-06T11:22:08.369036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:08.500385Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:08.500385Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:defecf5ad6ff548acc4c470b62212e260ee16b0e136faa478c86a84744aae7b4","observation_id":"37c58238-42ff-4bf9-953b-4bed40a2e803","resolution":{"observed_at":"2026-08-06T11:22:08.500385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.274420Z","title":"In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":"40ecfc89-6c5a-4d41-829e-de8253665104","year":null},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:08.066644Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:55054f24bfeae557c95aadf7a09a7d9537b93760300a0253db31fff2d6e1ffc7","observation_id":"1b3d9346-d2f6-4cd7-b211-1a9415148ae3","resolution":{"observed_at":"2026-08-06T11:22:13.277858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.254270Z","title":null,"venue":null,"work_id":"7d5bdee8-71b9-4998-99ed-471bf5dcd653","year":2024},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:08.744453Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:7845aa6c15aa8f2ad192ebc55ff691b959f9388677d95964e1c495e3e91c4bcf","observation_id":"a1931f7f-fb2e-4e03-a7c1-f53aa8c2a5ca","resolution":{"observed_at":"2026-08-06T11:22:13.257452Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.243284Z","title":null,"venue":null,"work_id":"82f6f975-aada-4fcc-ae39-d65d6844f9fc","year":2024},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:08.879157Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:01fd41fcf3ebeff4bc9b01160b747cb43e34781f21f8923ddba188b3ca92f057","observation_id":"c7509f94-6061-400e-a3ab-c688ac59ffe7","resolution":{"observed_at":"2026-08-06T11:22:13.246457Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:09.036940Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:09.036940Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:badc58779711b0719453fd334404a686ee491dc3d8ba85f99ec422c8ee047435","observation_id":"e50fe659-5e26-497c-971d-a732af370509","resolution":{"observed_at":"2026-08-06T11:22:09.036940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.226374Z","title":null,"venue":null,"work_id":"be55f4c2-c503-4443-97d3-2d61ec505973","year":2025},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:09.171661Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:726ae00016b672d398370df27162f102d8faa4ebd19cb46f1d5822fafe070191","observation_id":"aed89379-dbe6-4ca4-84f2-23e2fba0b7cc","resolution":{"observed_at":"2026-08-06T11:22:13.229217Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.265082Z","title":null,"venue":null,"work_id":"641c12c6-8935-4e97-8d97-f7e09c358ba2","year":2023},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:08.634729Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:190c434607ee9aea61b73e81a371a5ee382b36c7242e74470a9ee07dd5cd75ef","observation_id":"950af699-33d2-4395-a2a1-eb8434b832ca","resolution":{"observed_at":"2026-08-06T11:22:13.268243Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.210683Z","title":null,"venue":null,"work_id":"fad5a4b5-4ed4-4611-b24b-f6d346ee2dee","year":2023},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:09.397609Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:018db67944fe36af912981f0c4085f561ce156b3376a1a99175382ebec14c842","observation_id":"c6c5c237-94e7-4014-9c08-2d56396cf76f","resolution":{"observed_at":"2026-08-06T11:22:13.213411Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.200420Z","title":null,"venue":null,"work_id":"482d84aa-6c41-4b21-b15c-c6f7cd53667b","year":2019},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:09.470703Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:14fd0db7a2fd900f4979ba858263d24341e5c5a3cb965998fcaf1f71f454fef7","observation_id":"a0647a3f-c126-49dc-baa4-efa1791696ea","resolution":{"observed_at":"2026-08-06T11:22:13.204296Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2358.2021","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:12.025083Z","title":null,"venue":null,"work_id":"d98e53fd-a5bc-455d-aa1b-03671e37fde3","year":2021},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:09.527545Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:0d33c5360af9e040ac35a8403556b35136bd47a9002a52f7ac373b1d2a2f707e","observation_id":"d28d1515-0ce5-4446-99ca-2500ef15e566","resolution":{"observed_at":"2026-08-06T11:22:12.106579Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21227/67x4-9g14","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:11.538212Z","title":null,"venue":null,"work_id":"f5b19753-bd31-45b0-9e1b-7c7f77d0c77a","year":2024},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:09.564187Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:5293ed9b607cec85775dfc391a59fdd526fc398925c7306220e03617f425332b","observation_id":"eff0526c-e9e6-4ba3-991b-9c7ef0626f98","resolution":{"observed_at":"2026-08-06T11:22:11.616681Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:09.313558Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:09.313558Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:e63b5090bb3af34f78b0b19c30619b07190466b1da97ef0054769eb994e4deaa","observation_id":"21685015-2d51-4f6e-827e-06f166f1b562","resolution":{"observed_at":"2026-08-06T11:22:09.313558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.180665Z","title":null,"venue":null,"work_id":"1e6a2aa6-b57a-4ae8-a284-bd2eeed80321","year":2025},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:09.723169Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:73b46afc6058eb0e4f94fb32f59b481bc110852c44833b4152b98d77aeec54c0","observation_id":"f6e54fc4-3801-41d8-90dd-2a439f743eb6","resolution":{"observed_at":"2026-08-06T11:22:13.183491Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.171137Z","title":null,"venue":null,"work_id":"8bfb0d35-bdde-491f-94fc-88756eece37c","year":2024},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:09.753390Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:0abacea4189dba621c3e77481babb0f3328a77034fde6359900af36c8f446dce","observation_id":"69ecbad6-15f3-4c3e-b905-19afa07a3021","resolution":{"observed_at":"2026-08-06T11:22:13.174336Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.161418Z","title":null,"venue":null,"work_id":"53ea34d5-196c-40a6-8fa6-0c1b91db17c9","year":2015},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:09.841458Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:92658c77e5c56a88518d6fc8c94021e33ffdd114eab11218b4c03c1c5ed9db0b","observation_id":"550cf1ac-bb23-4821-b51c-c87adf33cdb1","resolution":{"observed_at":"2026-08-06T11:22:13.164644Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.ins.2022.03.026","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:11.382991Z","title":null,"venue":null,"work_id":"4af993be-623e-4e2f-9f7a-db301b4f72e1","year":2022},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:09.925918Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:29c78e3116aaab8b34805ef3465b5b3ebe9722d72b56aa5deabc0c59851a2d88","observation_id":"67a6ee80-0852-4adb-9752-93e8c9d8ef55","resolution":{"observed_at":"2026-08-06T11:22:11.459447Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.190401Z","title":null,"venue":null,"work_id":"f06fd0f6-80d2-4ab4-a484-8eab492af731","year":2024},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:09.652357Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:4a5794503062e0cd282c98f75d7398a3ebe3dbf9d3ee0ccf548a004fafa7cc2f","observation_id":"22cc9f4b-dd66-4b1d-9dc2-f81a0c8f42b5","resolution":{"observed_at":"2026-08-06T11:22:13.193431Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.151250Z","title":null,"venue":null,"work_id":"f4bc1833-816b-4cfe-81ff-6a7c400efccd","year":2024},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:10.171917Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:d50bd02bc98c8cf34d91c854a0deb2420d3227612dd1078da6fbe16362459b3f","observation_id":"aa3a5a36-b428-4ce8-b9ae-39384141ac51","resolution":{"observed_at":"2026-08-06T11:22:13.154808Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:10.252632Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:10.252632Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:69f98a5c02be9e081131c01059b33bf52cf02eee3150173b7ccb63ee7ab96791","observation_id":"4ac61163-a401-4056-a125-e57f5f5d7156","resolution":{"observed_at":"2026-08-06T11:22:10.252632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.141156Z","title":null,"venue":null,"work_id":"0909956b-9cc2-477b-96d9-bfde4583a746","year":2025},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:10.334837Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:a54547df1cb03f6a04d20831a6656db37f2f2a941a15979596d8e9c2fe4de94f","observation_id":"0de8c958-c5e2-4b57-982b-ef280b189337","resolution":{"observed_at":"2026-08-06T11:22:13.144085Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.130809Z","title":null,"venue":null,"work_id":"17961ca3-a696-426a-a511-29f13617e2ed","year":2025},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:10.411765Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:e64717825ceeb38d2408bb7ac080d8b02147bb5d0856f14ffe36c73d2915e2b3","observation_id":"8768b146-5d26-4721-b7fb-5b8611c43ba7","resolution":{"observed_at":"2026-08-06T11:22:13.134274Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00332","last_updated":"2023-06-16T09:07:11Z","snapshot_observed_at":"2026-08-05T18:44:00.793642Z","submitted_at":"2023-03-01T08:50:31Z","title":"CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00332","snapshot_observed_at":"2026-08-06T11:22:10.032757Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:10.032757Z"},"links":{"cited_paper":"/paper/2303.00332","citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:666d59a5cf306a28622d8071bd0096e99b8dfe3116ded38bf3cf25f1ad85fbca","observation_id":"1171e4f6-1351-435f-ae4e-ac3f5ac56389","resolution":{"observed_at":"2026-08-06T11:22:10.032757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.110105Z","title":null,"venue":null,"work_id":"472bb29f-4987-4a85-b539-7cbbbb60d224","year":2024},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:10.600580Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:2f8320d2f5391d8adf990c9657da287201f3211feadf4eed9bbab399c9f37559","observation_id":"f4053ef7-be47-4908-be0b-255e067d5932","resolution":{"observed_at":"2026-08-06T11:22:13.113630Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3625100","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:11.230444Z","title":null,"venue":null,"work_id":"e853b048-396a-48f1-866f-bf41cb6b270e","year":2024},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:10.642109Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:dc228fa672307d1aec1f76c08d980e3837a68d32dbb1f19b5a7000d94dbe2466","observation_id":"0fa8b4b3-86be-4b42-b828-3ba73d142268","resolution":{"observed_at":"2026-08-06T11:22:11.289869Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:10.727452Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:10.727452Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:c184ceee5b6ab2fc593b67c55af196b28c9c99345a56edf40bbd538941cfe88b","observation_id":"06a8dfcf-bfd4-46a4-8af0-f84c57d4259c","resolution":{"observed_at":"2026-08-06T11:22:10.727452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.092549Z","title":null,"venue":null,"work_id":"94bafc02-3000-4d32-bde6-3bc5c135e1a1","year":2025},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:10.821908Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:d3463060197cb52702c45648a2b020314ef978e8a24d2beb044f190616a8115b","observation_id":"b942b722-472b-4e67-bf01-648e65d2b7a8","resolution":{"observed_at":"2026-08-06T11:22:13.095957Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.121315Z","title":null,"venue":null,"work_id":"7085575a-58e2-45c1-b674-93db1929007e","year":2025},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:10.511071Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:0533811fff6d2f3c1c48ab933e80decc8202575e96210e91cff351e6928e89f5","observation_id":"e0b9dcc3-b21a-44a0-a7ba-60578e7b11f5","resolution":{"observed_at":"2026-08-06T11:22:13.124121Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:11.003082Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:11.003082Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:ea54727f7211c961a492ac786fda181c8b113efd1f4a69449e2d8009b9b48ad8","observation_id":"64682249-b972-4a9f-89aa-cf6e4eb7dae2","resolution":{"observed_at":"2026-08-06T11:22:11.003082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:12.879250Z","title":null,"venue":null,"work_id":"be7f669c-12c5-4fe8-b66a-8265d3f56dd6","year":2022},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:11.094770Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:64ff06c709da1d93159ffb769e586638627c1a62e9b235efe9e1a937eb80d94d","observation_id":"bf2b3cec-c6b8-4b10-b4dd-de27c27bcd7b","resolution":{"observed_at":"2026-08-06T11:22:12.967277Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.074336Z","title":null,"venue":null,"work_id":"b578a786-0c85-4525-a18f-0b3d0bd0b620","year":2021},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:10.908903Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:e8a00d576ea27317dc14f10434240b13591e99562ea9db1970d3e730e93591bd","observation_id":"d2f5310c-e3d0-4be9-801b-ded63e567e65","resolution":{"observed_at":"2026-08-06T11:22:13.083669Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.377169Z","title":"Pattern Analysis and Applications 25, 4 (2022), 981–992","venue":null,"work_id":"d2703682-2ed1-4140-aa01-09e3a7544637","year":2022},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:06.573227Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:2ab3811327bb8801709bbf42625bff270838cef8412a4c1fc3a956a0f09f9f71","observation_id":"8a192271-f78a-483e-b291-d47b09b5462c","resolution":{"observed_at":"2026-08-06T11:22:13.380191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:13.419750Z","title":"In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":"bc2a2caf-4b07-42de-8d90-7d2f324d323e","year":null},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:06.137860Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:afdb96856b06b6c682afddec8587378b2cac2ea9fad72e69544fddcd9c359052","observation_id":"413f7d4f-1e0c-4756-a4dd-e455d85535a7","resolution":{"observed_at":"2026-08-06T11:22:13.423278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1884.2024","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:22:12.609777Z","title":"In 2024 International Conference on Signal Processing, Computation, Electronics, Power and Telecommunication (IConSCEPT)","venue":null,"work_id":"28efc07c-7ce3-4bb2-b8a6-36af9ca9e806","year":2024},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:06.880564Z"},"links":{"citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:fe8190f228aa74a7a4badc45ef0761fc148eb87a347a59aae71f9ef38ff441ea","observation_id":"1b457127-83af-4786-8a86-36ed0d4483e1","resolution":{"observed_at":"2026-08-06T11:22:12.712624Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07803","last_updated":"2025-07-13T01:40:13Z","snapshot_observed_at":"2026-08-06T18:29:37.746431Z","submitted_at":"2025-07-10T14:28:39Z","title":"StreamUni: Achieving Streaming Speech Translation with a Unified Large Speech-Language Model","version":2},"cited_work":{"arxiv_id":"2507.07803","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.07803","snapshot_observed_at":"2026-08-06T11:22:12.357828Z","title":"StreamUni: Achieving Streaming Speech Translation with a Unified Large Speech-Language Model","venue":"cs.CL","work_id":"fb27e0c2-7066-43bf-b6be-ff66ec7f08b7","year":2025},"citing_paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T11:22:07.063747Z"},"links":{"cited_paper":"/paper/2507.07803","citing_paper":"/paper/2507.22781"},"observation_digest":"sha256:5edb8b38ecf0a2d7f9489d25435a126df5bc6ba8412d71d5315a79826eb48b05","observation_id":"e5348dba-3fe9-4ea4-a7fc-2ebc60caace8","resolution":{"observed_at":"2026-08-06T11:22:12.420970Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.22781","last_updated":"2025-07-30T15:47:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T08:22:56.571698Z","submitted_at":"2025-07-30T15:47:12Z","title":"HOLA: Enhancing Audio-visual Deepfake Detection via Hierarchical Contextual Aggregations and Efficient Pre-training"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":52,"verified_exact":6,"verified_fuzzy":3},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 0 inbound Pith citation observations for arXiv:2507.22781."}