{"as_of":"2026-08-08T08:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b1020664ae89ab58837633edf7f22f80be06ab5ad4198dd1957ae6d7a6ee4067","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:48:48.549041Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:48:45.412605Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:48:48.744686Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23524","last_updated":"2025-06-04T19:18:31Z","snapshot_observed_at":"2026-08-07T12:42:02.701919Z","submitted_at":"2025-05-29T15:03:59Z","title":"CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization","version":2},"cited_work":{"arxiv_id":"2505.23524","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23524","snapshot_observed_at":"2026-08-07T12:48:48.744686Z","title":"CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization","venue":"cs.CV","work_id":"8ad0123e-f3b7-40f5-beaa-e7aae85b8768","year":2025},"citing_paper":{"arxiv_id":"2505.23524","last_updated":"2025-06-04T19:18:31Z","snapshot_observed_at":"2026-08-07T12:42:02.701919Z","submitted_at":"2025-05-29T15:03:59Z","title":"CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:45.412605Z"},"links":{"cited_paper":"/paper/2505.23524","citing_paper":"/paper/2505.23524"},"observation_digest":"sha256:017148e4fd5ff7d0d95bcbf36ebc0877fd36e981159c2b07422ca4f482701405","observation_id":"b8a62b15-6959-49e3-a1fd-6abd14e3d672","resolution":{"observed_at":"2026-08-07T12:48:48.858700Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23524/citation-record","integrity":"/paper/2505.23524/integrity","json":"/paper/2505.23524/citation-record.json","paper":"/paper/2505.23524"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:54.939290Z","title":"Tradi- tional methods primarily focus on identifying the most rele- vant videos based on a given query [1]","venue":null,"work_id":"c79f285a-8b24-4438-8659-0b98e395629a","year":null},"citing_paper":{"arxiv_id":"2505.23524","last_updated":"2025-06-04T19:18:31Z","snapshot_observed_at":"2026-08-07T12:42:02.701919Z","submitted_at":"2025-05-29T15:03:59Z","title":"CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:45.288073Z"},"links":{"citing_paper":"/paper/2505.23524"},"observation_digest":"sha256:52fcad1b93fea956a35af2ed97e2573c6cb3b2eaf6ae9f48f1b51b6e4bca5fa2","observation_id":"be7dd9f4-c7b6-44a7-9938-a620c55f2b37","resolution":{"observed_at":"2026-08-07T12:48:55.060702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23524","last_updated":"2025-06-04T19:18:31Z","snapshot_observed_at":"2026-08-07T12:42:02.701919Z","submitted_at":"2025-05-29T15:03:59Z","title":"CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization","version":2},"cited_work":{"arxiv_id":"2505.23524","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23524","snapshot_observed_at":"2026-08-07T12:48:48.744686Z","title":"CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization","venue":"cs.CV","work_id":"8ad0123e-f3b7-40f5-beaa-e7aae85b8768","year":2025},"citing_paper":{"arxiv_id":"2505.23524","last_updated":"2025-06-04T19:18:31Z","snapshot_observed_at":"2026-08-07T12:42:02.701919Z","submitted_at":"2025-05-29T15:03:59Z","title":"CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:45.412605Z"},"links":{"cited_paper":"/paper/2505.23524","citing_paper":"/paper/2505.23524"},"observation_digest":"sha256:017148e4fd5ff7d0d95bcbf36ebc0877fd36e981159c2b07422ca4f482701405","observation_id":"b8a62b15-6959-49e3-a1fd-6abd14e3d672","resolution":{"observed_at":"2026-08-07T12:48:48.858700Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:54.655293Z","title":"Pre-trained audio, VLP, and CBP feature extractors first extractF audio,F CBP , andF V LP features","venue":null,"work_id":"794b7a0c-ea42-497a-984f-eaf4b14b2bd5","year":null},"citing_paper":{"arxiv_id":"2505.23524","last_updated":"2025-06-04T19:18:31Z","snapshot_observed_at":"2026-08-07T12:42:02.701919Z","submitted_at":"2025-05-29T15:03:59Z","title":"CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:45.570821Z"},"links":{"citing_paper":"/paper/2505.23524"},"observation_digest":"sha256:5e4b341c62c8fd4c231135c8ac246ab61f181339151775a75b2f26dfae4e3a19","observation_id":"b4972a19-a7db-48a8-b0dc-916c2c9ecc51","resolution":{"observed_at":"2026-08-07T12:48:54.769020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:54.388631Z","title":"Datasets THUMOS14consists of 200 validation and 213 test videos across 20 action classes, averaging 15 action segments per video","venue":null,"work_id":"7a45e49f-a651-496e-9e1b-b20d21b03ea2","year":null},"citing_paper":{"arxiv_id":"2505.23524","last_updated":"2025-06-04T19:18:31Z","snapshot_observed_at":"2026-08-07T12:42:02.701919Z","submitted_at":"2025-05-29T15:03:59Z","title":"CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:45.706456Z"},"links":{"citing_paper":"/paper/2505.23524"},"observation_digest":"sha256:bc45f658211496f034bd7017c42fb1f91b3c7b8bad86fd8dab6c0c0a04eeaff9","observation_id":"7fc4dc23-0ae0-46ec-8056-d21829e2a281","resolution":{"observed_at":"2026-08-07T12:48:54.499112Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:54.079021Z","title":"This is the first time CLIP and audio are incorporated into UTAL","venue":null,"work_id":"ddd257f5-3850-4dbd-93df-5451e1bfad22","year":null},"citing_paper":{"arxiv_id":"2505.23524","last_updated":"2025-06-04T19:18:31Z","snapshot_observed_at":"2026-08-07T12:42:02.701919Z","submitted_at":"2025-05-29T15:03:59Z","title":"CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:45.858643Z"},"links":{"citing_paper":"/paper/2505.23524"},"observation_digest":"sha256:5880407b6b297f25e6fb066dbc55264ce2774c135a2b499a91403eedf62b43d2","observation_id":"9d21f908-8417-4162-9ee9-31e60b9c2cb9","resolution":{"observed_at":"2026-08-07T12:48:54.205295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:53.862360Z","title":null,"venue":null,"work_id":"c9a8cdae-0dc3-405a-85a7-f9abb69320a0","year":null},"citing_paper":{"arxiv_id":"2505.23524","last_updated":"2025-06-04T19:18:31Z","snapshot_observed_at":"2026-08-07T12:42:02.701919Z","submitted_at":"2025-05-29T15:03:59Z","title":"CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:45.938182Z"},"links":{"citing_paper":"/paper/2505.23524"},"observation_digest":"sha256:4853dab57acd06566e50c82c5d0643e7f79353da6c50035e7b3e31f4ff0d1ffc","observation_id":"972e97a1-c7f6-466f-8b0d-dd926d4e3e0a","resolution":{"observed_at":"2026-08-07T12:48:53.972067Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:53.516753Z","title":"Two-stream consensus network for weakly-supervised temporal action local- ization,","venue":null,"work_id":"371dc30c-0aae-4061-943a-4fb9542aa28f","year":2020},"citing_paper":{"arxiv_id":"2505.23524","last_updated":"2025-06-04T19:18:31Z","snapshot_observed_at":"2026-08-07T12:42:02.701919Z","submitted_at":"2025-05-29T15:03:59Z","title":"CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:46.145963Z"},"links":{"citing_paper":"/paper/2505.23524"},"observation_digest":"sha256:e65be37c2dc3ffe1c1bd5e57a202481f2bb00e339868912329233d00a87c7c46","observation_id":"4ab952d0-c16a-479a-86a9-f0da1962b537","resolution":{"observed_at":"2026-08-07T12:48:53.658122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:53.229226Z","title":"Weakly-supervised temporal action lo- calization by inferring salient snippet-feature,","venue":null,"work_id":"1637ae44-bdd8-4f68-8c3c-d9585d572586","year":2024},"citing_paper":{"arxiv_id":"2505.23524","last_updated":"2025-06-04T19:18:31Z","snapshot_observed_at":"2026-08-07T12:42:02.701919Z","submitted_at":"2025-05-29T15:03:59Z","title":"CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:46.302868Z"},"links":{"citing_paper":"/paper/2505.23524"},"observation_digest":"sha256:9c88fed477b53e0a9435593778af7855ff857b825855ea9546406ab598fcc8bf","observation_id":"0d566cc5-1f04-4187-a95c-7326fd47617b","resolution":{"observed_at":"2026-08-07T12:48:53.362935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:52.893742Z","title":"Two-stream networks for weakly-supervised temporal action local- ization with semantic-aware mechanisms,","venue":null,"work_id":"984e1614-54bf-4964-85c3-b6e4cc48860a","year":2023},"citing_paper":{"arxiv_id":"2505.23524","last_updated":"2025-06-04T19:18:31Z","snapshot_observed_at":"2026-08-07T12:42:02.701919Z","submitted_at":"2025-05-29T15:03:59Z","title":"CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:46.477326Z"},"links":{"citing_paper":"/paper/2505.23524"},"observation_digest":"sha256:f14bc20c554972294e9244bb1be0d24da946084c1f847881390e0ef57164bddc","observation_id":"9f980152-557e-422b-acdd-578e05553ac2","resolution":{"observed_at":"2026-08-07T12:48:53.071181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08466","last_updated":"2025-06-09T12:58:32Z","snapshot_observed_at":"2026-08-06T19:37:37.155518Z","submitted_at":"2024-11-13T09:37:24Z","title":"Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08466","snapshot_observed_at":"2026-08-07T12:48:46.650668Z","title":"Can mllms guide weakly- supervised temporal action localization tasks?,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23524","last_updated":"2025-06-04T19:18:31Z","snapshot_observed_at":"2026-08-07T12:42:02.701919Z","submitted_at":"2025-05-29T15:03:59Z","title":"CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:46.650668Z"},"links":{"cited_paper":"/paper/2411.08466","citing_paper":"/paper/2505.23524"},"observation_digest":"sha256:6de5893cf6f9a658fded4cfb8b0eb65dc9ac614de3f8990188bc2eb96f3e0ad1","observation_id":"bedf9601-f849-45c1-893d-4433e4ec5471","resolution":{"observed_at":"2026-08-07T12:48:46.650668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:52.602749Z","title":"Rethinking pseudo-label guided learning for weakly supervised temporal action localization from the perspective of noise correction,","venue":null,"work_id":"0ad170b1-62ad-47aa-a196-e566510303c6","year":2025},"citing_paper":{"arxiv_id":"2505.23524","last_updated":"2025-06-04T19:18:31Z","snapshot_observed_at":"2026-08-07T12:42:02.701919Z","submitted_at":"2025-05-29T15:03:59Z","title":"CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:46.819500Z"},"links":{"citing_paper":"/paper/2505.23524"},"observation_digest":"sha256:b45ef958763b8f5e803fd1aa496cac279287b6b59c948d22282af3a42bb15811","observation_id":"526873f1-ab5e-4d40-ad72-37b7d1b01cb6","resolution":{"observed_at":"2026-08-07T12:48:52.740062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:52.244599Z","title":"Apsl: Action-positive separation learning for unsupervised temporal action localization,","venue":null,"work_id":"03d894a1-6e98-4f2b-8294-9974ea983b79","year":2023},"citing_paper":{"arxiv_id":"2505.23524","last_updated":"2025-06-04T19:18:31Z","snapshot_observed_at":"2026-08-07T12:42:02.701919Z","submitted_at":"2025-05-29T15:03:59Z","title":"CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:46.937683Z"},"links":{"citing_paper":"/paper/2505.23524"},"observation_digest":"sha256:45caaef5fa187ce00d11e5be505dc8d965d0d90db36fb9a43a97bac88b8f918e","observation_id":"1eb1bdc3-2c6b-4836-badc-0f02d60d79f2","resolution":{"observed_at":"2026-08-07T12:48:52.443787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:51.891800Z","title":"Learning temporal co-attention models for unsupervised video action localization,","venue":null,"work_id":"333a93be-f07a-47c1-a466-04aa865189f5","year":2020},"citing_paper":{"arxiv_id":"2505.23524","last_updated":"2025-06-04T19:18:31Z","snapshot_observed_at":"2026-08-07T12:42:02.701919Z","submitted_at":"2025-05-29T15:03:59Z","title":"CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:47.187380Z"},"links":{"citing_paper":"/paper/2505.23524"},"observation_digest":"sha256:8ccc544454ba5cdb11590c29497a3b0649cd9bb8151a35b15b90b05631817294","observation_id":"e54e0186-25fe-479a-acec-d8f5c2c77a5d","resolution":{"observed_at":"2026-08-07T12:48:52.029311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:51.552785Z","title":"Uncertainty guided collaborative training for weakly supervised and unsupervised temporal action localization,","venue":null,"work_id":"42ef5d52-9c56-49ae-8da3-8c06deec5d7d","year":2022},"citing_paper":{"arxiv_id":"2505.23524","last_updated":"2025-06-04T19:18:31Z","snapshot_observed_at":"2026-08-07T12:42:02.701919Z","submitted_at":"2025-05-29T15:03:59Z","title":"CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:47.327506Z"},"links":{"citing_paper":"/paper/2505.23524"},"observation_digest":"sha256:4b82d1ce309f1e9343731e735063fc118a005dfd5be792d73488da0032d4306e","observation_id":"d4322ed8-362d-4821-a264-28948253a0cc","resolution":{"observed_at":"2026-08-07T12:48:51.717507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:51.123698Z","title":"Revisiting foreground and background separation in weakly-supervised temporal action local- ization: A clustering-based approach,","venue":null,"work_id":"e24a1f08-1711-4926-8056-746b52a5d415","year":2023},"citing_paper":{"arxiv_id":"2505.23524","last_updated":"2025-06-04T19:18:31Z","snapshot_observed_at":"2026-08-07T12:42:02.701919Z","submitted_at":"2025-05-29T15:03:59Z","title":"CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:47.485299Z"},"links":{"citing_paper":"/paper/2505.23524"},"observation_digest":"sha256:c367fd27c0a5ab5a50b833883321116f10684eddc7c9cd1060723cea8d1f2556","observation_id":"1203afcb-20bb-4cbc-ae52-0b04790e2c0b","resolution":{"observed_at":"2026-08-07T12:48:51.345450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:50.857698Z","title":"Weakly supervised action localization by sparse temporal pooling network,","venue":null,"work_id":"75ecde67-a654-4657-ba50-105625a10700","year":2018},"citing_paper":{"arxiv_id":"2505.23524","last_updated":"2025-06-04T19:18:31Z","snapshot_observed_at":"2026-08-07T12:42:02.701919Z","submitted_at":"2025-05-29T15:03:59Z","title":"CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:47.600169Z"},"links":{"citing_paper":"/paper/2505.23524"},"observation_digest":"sha256:b5c890e793ee84978d8be9266e5171b96f3fc3750b1f34205be326aff9a3679c","observation_id":"2b287037-7dee-41e7-b1c1-deed347d2a52","resolution":{"observed_at":"2026-08-07T12:48:50.957971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:50.670557Z","title":"Weakly-supervised action localization with background modeling,","venue":null,"work_id":"e3f100e5-1a53-429e-9a96-daec9c45d6d1","year":2019},"citing_paper":{"arxiv_id":"2505.23524","last_updated":"2025-06-04T19:18:31Z","snapshot_observed_at":"2026-08-07T12:42:02.701919Z","submitted_at":"2025-05-29T15:03:59Z","title":"CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:47.796538Z"},"links":{"citing_paper":"/paper/2505.23524"},"observation_digest":"sha256:b5121cc3c54695e167141a8855347bb1c5b57539a2f63e7c6efc766fc46314a4","observation_id":"571033fb-cc77-4cb0-ae8d-758dfd04c236","resolution":{"observed_at":"2026-08-07T12:48:50.754831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:50.423933Z","title":"Proposal-based multiple instance learning for weakly-supervised temporal action localization,","venue":null,"work_id":"18b097e8-94c3-4e8d-a084-a88625f6f5d3","year":2023},"citing_paper":{"arxiv_id":"2505.23524","last_updated":"2025-06-04T19:18:31Z","snapshot_observed_at":"2026-08-07T12:42:02.701919Z","submitted_at":"2025-05-29T15:03:59Z","title":"CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:47.946877Z"},"links":{"citing_paper":"/paper/2505.23524"},"observation_digest":"sha256:b8b58bcc08d4b68ccb85d1d7ac67918020ac07e8272977120d3010fd35a9918c","observation_id":"3c64e08f-d674-44af-a81b-f7b95e026678","resolution":{"observed_at":"2026-08-07T12:48:50.527963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:50.012138Z","title":"IMDPrompter: Adapting SAM to image manipulation detection by cross-view au- tomated prompt learning,","venue":null,"work_id":"20da0987-40e6-4245-9dc9-fb779c4ec48a","year":2025},"citing_paper":{"arxiv_id":"2505.23524","last_updated":"2025-06-04T19:18:31Z","snapshot_observed_at":"2026-08-07T12:42:02.701919Z","submitted_at":"2025-05-29T15:03:59Z","title":"CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:48.045654Z"},"links":{"citing_paper":"/paper/2505.23524"},"observation_digest":"sha256:f299643f9b167b56b8f81ad739a49f3d4c829fdfe30d939960a04c36751541b1","observation_id":"3d868298-5ba4-48a8-aeff-daaad0a00920","resolution":{"observed_at":"2026-08-07T12:48:50.257347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:49.658276Z","title":"Gim: A million-scale benchmark for generative image manipulation detection and localization,","venue":null,"work_id":"cff9bf71-175f-4f53-b24c-194894e22ef5","year":2025},"citing_paper":{"arxiv_id":"2505.23524","last_updated":"2025-06-04T19:18:31Z","snapshot_observed_at":"2026-08-07T12:42:02.701919Z","submitted_at":"2025-05-29T15:03:59Z","title":"CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:48.218893Z"},"links":{"citing_paper":"/paper/2505.23524"},"observation_digest":"sha256:a7dd850743ca9dd40282a27fc848e17283f96abcae77b41c04802fe171006c1f","observation_id":"1ce0dbff-495f-464a-9a6d-e5fbfb64174c","resolution":{"observed_at":"2026-08-07T12:48:49.843937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:49.317482Z","title":"Seeing beyond noise: Joint graph structure evaluation and denoising for mul- timodal recommendation,","venue":null,"work_id":"c7108b43-64e1-4f79-a236-c6e7ff2c5c2b","year":2025},"citing_paper":{"arxiv_id":"2505.23524","last_updated":"2025-06-04T19:18:31Z","snapshot_observed_at":"2026-08-07T12:42:02.701919Z","submitted_at":"2025-05-29T15:03:59Z","title":"CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:48.390480Z"},"links":{"citing_paper":"/paper/2505.23524"},"observation_digest":"sha256:2af754ac2c74b7131fe6ee323620a947be7bd52c05acc2a831308756911c9a77","observation_id":"af09fa38-d8d3-47cb-8882-7144e755d5c9","resolution":{"observed_at":"2026-08-07T12:48:49.414467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:48:49.021746Z","title":"Distilling semantic priors from sam to effi- cient image restoration models,","venue":null,"work_id":"cb016259-cf33-4c7e-9958-4bae7fdb7a0d","year":2024},"citing_paper":{"arxiv_id":"2505.23524","last_updated":"2025-06-04T19:18:31Z","snapshot_observed_at":"2026-08-07T12:42:02.701919Z","submitted_at":"2025-05-29T15:03:59Z","title":"CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:48:48.549041Z"},"links":{"citing_paper":"/paper/2505.23524"},"observation_digest":"sha256:b2311d93ed92aa2116314d7d24cc9153325af535a1b8217ad7120f1b46851c52","observation_id":"e236e4ff-3518-4f22-8806-362f13497fa1","resolution":{"observed_at":"2026-08-07T12:48:49.123969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23524","last_updated":"2025-06-04T19:18:31Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T12:42:02.701919Z","submitted_at":"2025-05-29T15:03:59Z","title":"CLIP-AE: CLIP-assisted Cross-view Audio-Visual Enhancement for Unsupervised Temporal Action Localization"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 1 inbound Pith citation observation for arXiv:2505.23524."}