{"as_of":"2026-08-08T05:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2861f203aff3a7793325dbfb73b9735a0738d3cfc51b7b82941fe2546da7f7be","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:53:02.484752Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T03:03:13.496634Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T03:06:19.413098Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"cited_work":{"arxiv_id":"2506.23196","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23196","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Del: Dense event localization for multi-modal audio-visual understanding","venue":null,"work_id":"38b8b93c-3953-4803-a196-905c540218c3","year":2025},"citing_paper":{"arxiv_id":"2605.08723","last_updated":"2026-05-09T06:13:27Z","snapshot_observed_at":"2026-07-06T23:20:57.084438Z","submitted_at":"2026-05-09T06:13:27Z","title":"EAR: Enhancing Uni-Modal Representations for Weakly Supervised Audio-Visual Video Parsing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T03:03:13.496634Z"},"links":{"cited_paper":"/paper/2506.23196","citing_paper":"/paper/2605.08723"},"observation_digest":"sha256:8c078d708e46bdc495d80100c60f81875a9089d9a3ea165b04ac3a3311684da1","observation_id":"47b14a0d-d100-4117-a088-aa437b827869","resolution":{"observed_at":"2026-05-12T03:06:19.415238Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.23196/citation-record","integrity":"/paper/2506.23196/integrity","json":"/paper/2506.23196/citation-record.json","paper":"/paper/2506.23196"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:12.126000Z","title":"Maas: Multi-modal assignation for active speaker detection","venue":null,"work_id":"6d30db51-7bea-4a9f-8762-b098b07c095c","year":2021},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:56.383564Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:a284353b4e34d53086498e3e08f7335daa5cda62ae499fe360c2389444596c9e","observation_id":"6adf58fb-1397-49f7-ac85-0b38c8e91849","resolution":{"observed_at":"2026-08-06T21:53:12.228540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.14118","last_updated":"2021-10-17T17:41:25Z","snapshot_observed_at":"2026-07-06T11:23:26.988614Z","submitted_at":"2021-06-27T00:49:02Z","title":"Hear Me Out: Fusional Approaches for Audio Augmented Temporal Action Localization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.14118","snapshot_observed_at":"2026-08-06T21:52:56.439313Z","title":"Hear me out: Fusional ap- proaches for audio augmented temporal action localization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:56.439313Z"},"links":{"cited_paper":"/paper/2106.14118","citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:84bb28726756182a860d8937b65ada6ceec0be36e1b174b99d76ac101ef48153","observation_id":"28ad82c1-9139-4562-a667-3d761d6b933e","resolution":{"observed_at":"2026-08-06T21:52:56.439313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:11.933197Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":"d57bbcf6-1b1b-4a1c-a0c3-bf22e38e30eb","year":2015},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:56.521994Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:87436dc7ba7ea398ba82461b0e7478aa164a8e6c5b58596f6f8c64e5b1681026","observation_id":"d47090ca-d83c-438b-ae89-a2525b2859f1","resolution":{"observed_at":"2026-08-06T21:53:12.031192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:11.724553Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":"08615b9a-5e5c-4db1-b41d-2b92bc35cbc8","year":2017},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:56.624292Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:186618d74617ca614f51656b876cea3a261c5610cdbc84c6cda2a5ec578b22c8","observation_id":"571de3b4-4ced-492a-bbb9-51b03117b901","resolution":{"observed_at":"2026-08-06T21:53:11.821632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:11.546365Z","title":"Augmented transformer with adaptive graph for tem- poral action proposal generation","venue":null,"work_id":"71674c39-6963-499e-b5b2-375c1a5544ef","year":2022},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:56.734272Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:ce9888510aa99f31e04840db57a24144af7473716aee6d0077eb94db6ba84d6e","observation_id":"7803e0e6-ca3a-4bb7-bcb6-0a03ba5ed688","resolution":{"observed_at":"2026-08-06T21:53:11.636257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:11.390184Z","title":"Re- thinking the faster r-cnn architecture for temporal action localization","venue":null,"work_id":"706462bf-f37a-48b7-a775-7bb758599443","year":null},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:56.792960Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:3967258f1a1a58ade73d23be675ee84e1247538fc07e863a5fad6ee33bcb6cbe","observation_id":"7951d87f-64e0-4430-b5da-69ee90e7f60b","resolution":{"observed_at":"2026-08-06T21:53:11.462906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:11.164642Z","title":"Tallformer: Temporal ac- tion localization with a long-memory transformer","venue":null,"work_id":"517864fc-c9ad-4f11-9996-1d350cf7b216","year":2022},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:56.866148Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:7a049f77466430e6dfb6c7171854d067d046b95d3a60a6188033cbf0b0f106bd","observation_id":"e9949550-2b40-4f80-abfb-904784a08b92","resolution":{"observed_at":"2026-08-06T21:53:11.244143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:56.942447Z","title":"Yolo-world: Real-time open-vocabulary object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:56.942447Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:5e25ed64bc001e2559f951af5c7f2f986fb99b881147bf7be0319f6dc3aba479","observation_id":"86994997-3545-44b3-b9fa-b88eb1c620a3","resolution":{"observed_at":"2026-08-06T21:52:56.942447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:10.948859Z","title":"Rescaling egocentric vision: Collection, pipeline and chal- lenges for epic-kitchens-100","venue":null,"work_id":"d34230ed-c950-436f-a17e-ac214d0abc23","year":2022},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:57.080544Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:81f383c81dac288d55ebebfee896ecaf2d7eadfd3295c8227d748fb194c36c2b","observation_id":"ad95e9b2-49f4-46ee-8d25-d3c8b3e77441","resolution":{"observed_at":"2026-08-06T21:53:11.029369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:10.785256Z","title":"Slowfast networks for video recognition","venue":null,"work_id":"8e4e708e-1ae5-4038-a2b7-09e1f2865338","year":2019},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:57.209727Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:3af8e838ac732b7e1dc109828cd3306b9cd4c7f3d8235cf5dae0b2423ac80491","observation_id":"839918ca-bc76-4068-b0b0-a4420566535b","resolution":{"observed_at":"2026-08-06T21:53:10.855384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03456","last_updated":"2023-10-05T10:54:33Z","snapshot_observed_at":"2026-07-06T16:28:09.133233Z","submitted_at":"2023-10-05T10:54:33Z","title":"Multi-Resolution Audio-Visual Feature Fusion for Temporal Action Localization","version":1},"cited_work":{"arxiv_id":"2310.03456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.03456","snapshot_observed_at":"2026-08-06T21:53:02.689944Z","title":"Multi-Resolution Audio-Visual Feature Fusion for Temporal Action Localization","venue":"cs.CV","work_id":"ca79e3f9-aa1c-4e2c-8ed4-fd1361de3ad2","year":2023},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:57.316945Z"},"links":{"cited_paper":"/paper/2310.03456","citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:99078dbfe3204fe2fef06d80d639bdc8ec635de6e30b579aeb6206070ec32d73","observation_id":"4945c444-97ff-41ba-8e53-54c9f5253efe","resolution":{"observed_at":"2026-08-06T21:53:02.785904Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:10.566086Z","title":"Audio set: An ontology and human- labeled dataset for audio events","venue":null,"work_id":"47c95c30-64f2-4e1a-ab39-0088d25be2dc","year":2017},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:57.408175Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:4c87180e03b96bac1ab1e67fb1fa48cf801f02ed2065f77f4e66c2ad57ba3b12","observation_id":"1ff4a861-5dc7-4132-94a8-9ed8a34b6d33","resolution":{"observed_at":"2026-08-06T21:53:10.698271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:10.384123Z","title":"Dense-localizing audio-visual events in untrimmed videos: A large-scale benchmark and baseline","venue":null,"work_id":"bf8eae95-6300-4db3-bf15-2e098d024725","year":2023},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:57.495631Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:2cefba1526d3b3f2b135b4073515d54d6cd0d911c6ecbd99583c69d97ade6567","observation_id":"c02bd514-8400-48f0-aab9-74bc46808358","resolution":{"observed_at":"2026-08-06T21:53:10.463129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:57.588220Z","title":"Momentum contrast for unsupervised visual rep- resentation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:57.588220Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:16378c132553c03c4c27b3a79769b7f3f7340647f4b7652fa019247e79277612","observation_id":"8c37d1a1-7b8a-46d5-88bd-e30a619c88e8","resolution":{"observed_at":"2026-08-06T21:52:57.588220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:10.155971Z","title":"Cnn archi- tectures for large-scale audio classification","venue":null,"work_id":"3620c5d8-dfcf-4d84-b7cd-eb64c51094f2","year":2017},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:57.718925Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:6be5740722c40a54725796597434ca7fac4f72368c1f7499cdc1b69ed36d9b7e","observation_id":"6c7fba88-18db-429b-b253-bbc1b260e576","resolution":{"observed_at":"2026-08-06T21:53:10.259205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:57.797874Z","title":"Mix and local- ize: Localizing sound sources in mixtures","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:57.797874Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:3233ba497cffe6d0a693b0ca52d76079bf2e65b6fef0618cf90aa01d3493cae3","observation_id":"4dda55a1-49df-46a2-b808-68de94d62b04","resolution":{"observed_at":"2026-08-06T21:52:57.797874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:09.918062Z","title":"in the wild","venue":null,"work_id":"f001188f-8627-461d-86a7-318a628e358b","year":2017},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:57.881569Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:77f1db767d3112b56574e00c78384106221ff2ea9d3daf85e25b2f5fe26e56b2","observation_id":"45643fd4-60c9-4124-aee3-f8be220466a2","resolution":{"observed_at":"2026-08-06T21:53:10.051074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:09.732267Z","title":"Causal inference meets deep learning: A compre- hensive survey","venue":null,"work_id":"5656377d-cea7-41c1-9978-469dbe64abed","year":2024},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:58.000025Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:ba7f861731f6e1e980b9da740947bf03ff602645b10abf3db20f6b3b062806eb","observation_id":"80271b71-b850-4d92-9f4c-96a1906fe8c5","resolution":{"observed_at":"2026-08-06T21:53:09.820174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:09.554582Z","title":"Epic-fusion: Audio-visual temporal bind- ing for egocentric action recognition","venue":null,"work_id":"47e1452a-d3e0-49be-ab65-08b9b1984f47","year":2019},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:58.137657Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:9d47e50dbd963e4b3ea1f2d119be2e06e611730c25afd80608cc0cdfc35acc1e","observation_id":"b31a13d5-21c4-4f59-8c87-5aed19bb0808","resolution":{"observed_at":"2026-08-06T21:53:09.637366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00107","last_updated":"2024-12-27T12:28:34Z","snapshot_observed_at":"2026-08-06T16:16:34.606158Z","submitted_at":"2023-05-31T18:27:43Z","title":"MERT: Acoustic Music Understanding Model with Large-Scale Self-supervised Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00107","snapshot_observed_at":"2026-08-06T21:52:58.255447Z","title":"Mert: Acoustic music un- derstanding model with large-scale self-supervised training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:58.255447Z"},"links":{"cited_paper":"/paper/2306.00107","citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:f4885a7269d724bb305c0f90ccde9833d459698d67cdd7c1d873a2fec201a9e5","observation_id":"174d3af3-f042-43d5-b345-337e0e8e60ae","resolution":{"observed_at":"2026-08-06T21:52:58.255447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:09.386826Z","title":"Learning salient boundary feature for anchor- free temporal action localization","venue":null,"work_id":"06bbd831-300d-4a19-9a9e-8bc8a4024a5a","year":2021},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:58.345630Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:a0b028da63694f8352c62a0f238211624badc2a1bf03857973f98c01ba73fbee","observation_id":"67fe8343-b81f-444f-9065-b2f8139842fa","resolution":{"observed_at":"2026-08-06T21:53:09.492907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:09.267775Z","title":"Bsn: Boundary sensitive network for temporal action proposal generation","venue":null,"work_id":"d632230f-65a2-4421-acaa-3fc6a0824908","year":2018},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:58.449901Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:e989fad72e473b805cfd1544ab751a0bd58ad14574ce54d844dbc146b22eb7c0","observation_id":"9f0d2f44-002d-4240-addb-f9b5143a8927","resolution":{"observed_at":"2026-08-06T21:53:09.315122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:58.542307Z","title":"Bmn: Boundary-matching network for temporal action pro- posal generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:58.542307Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:164e464f12bd163087e8253d2f82667c99d1c539747099f3967e4bb495d5fab7","observation_id":"4f7e9a09-c5c0-4f1b-b4aa-68115365b8dc","resolution":{"observed_at":"2026-08-06T21:52:58.542307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:09.129323Z","title":"Progressive boundary refine- ment network for temporal action detection","venue":null,"work_id":"6f02f8e0-3025-426f-85b6-942f7da68b26","year":2020},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:58.669443Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:021a593b14952304073b9ba8127b748e3a252298de4f51b5549e4603b399a580","observation_id":"c11b35a9-a764-4db3-b9e1-42bc4f26be31","resolution":{"observed_at":"2026-08-06T21:53:09.184494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:08.952276Z","title":"Dense modality interaction network for audio-visual event localization","venue":null,"work_id":"5341bb0d-2165-4836-ae67-a4aafc4800b2","year":2022},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:58.774936Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:f757cfaa8351c9aaa256e46f9712535bd485ac4c98175ceb61428bd7579c0bee","observation_id":"145a2007-89c2-451d-8ebb-17466280acb4","resolution":{"observed_at":"2026-08-06T21:53:09.038197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:08.812696Z","title":"Multi-shot temporal event localization: a benchmark","venue":null,"work_id":"3de77432-0f7a-49c4-b4f1-40293367747c","year":2021},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:58.879243Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:2524bfe437036adfeed81f5c3dcf2a51552b278be71c07f483cf9016b03fb67d","observation_id":"8e6cbd72-b2e8-469b-be94-c96ae7f4cf77","resolution":{"observed_at":"2026-08-06T21:53:08.873567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:08.614754Z","title":"End-to-end temporal ac- tion detection with transformer.IEEE Transactions on Image Processing, 31:5427–5441, 2022","venue":null,"work_id":"5f2c29d1-fdbc-4b1f-b6e0-d520bd4222e3","year":2022},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:58.983937Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:05a13bb8bfddd758a9d74dc29a93aae5df5b92fe02db80d89f3d7cc371cb8e9c","observation_id":"26109f82-ccde-42db-88d9-595505edf9da","resolution":{"observed_at":"2026-08-06T21:53:08.703945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:08.448935Z","title":"Gaussian temporal awareness networks for action localization","venue":null,"work_id":"dac6920e-daf2-4d24-8aca-b3f5c35f0aa1","year":2019},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.119360Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:4c105aad4aa36be39395d78805d27fa26a8e89dd5bc5ea2fb7693128c0c46c68","observation_id":"0a9edb4e-f849-4d1f-8cdc-95ea4c662f25","resolution":{"observed_at":"2026-08-06T21:53:08.524721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:08.320655Z","title":"Proposal-free temporal action detection via global segmen- tation mask learning","venue":null,"work_id":"48dbd3f0-e4bb-42d6-a350-d07a65b6dca5","year":2022},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.215515Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:c18bf4eb752795c7c2c05f3678089cf0767f206b73f1a07c0d69c7400b0c45ea","observation_id":"cbf46e29-3e88-4069-84ca-3f61652542e3","resolution":{"observed_at":"2026-08-06T21:53:08.374265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:08.118515Z","title":"Attention bottlenecks for multimodal fusion","venue":null,"work_id":"b06d822c-5d63-41ee-8794-ade68459eb8f","year":2021},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.303981Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:5861299a4bc72b14a22fc84f2125d01b7e2a75eb705725d2b182cd5bb27c69c4","observation_id":"f4bc45dc-7480-4baa-8f38-360c9f7af30d","resolution":{"observed_at":"2026-08-06T21:53:08.185290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T21:52:59.408856Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.408856Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:5a60082ffbf46debb68ce5b239d6f59b60332c9574a355161e0f52129c2d2cd9","observation_id":"fc53abfb-da85-4cd7-a9d3-e13ef2b7475a","resolution":{"observed_at":"2026-08-06T21:52:59.408856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:07.977008Z","title":"Audio-visual scene analysis with self-supervised multisensory features","venue":null,"work_id":"6b115faa-4b9f-4d66-afcd-a42a8b455b70","year":2018},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.543003Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:eb4bf19157053ae6e4cc12baa68b03d0902c1e48ee58b9e841fad8bac911989a","observation_id":"57daa4b0-d0df-4a9f-90cc-335b1600a2e1","resolution":{"observed_at":"2026-08-06T21:53:08.046715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:07.796322Z","title":"A review of deep learning techniques in audio event recognition (aer) applications","venue":null,"work_id":"d326412f-a714-4de7-9c9a-4da40f88ecb7","year":2024},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.622948Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:60486fd4ee1dd145529bbd93efd49915996750ddad9538ad9a0ee6fde29cd8b4","observation_id":"ccab2e5c-8bc7-4cca-a040-28fc3e3f8836","resolution":{"observed_at":"2026-08-06T21:53:07.877014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:07.621586Z","title":"Owl (observe, watch, listen): Audiovisual temporal context for localizing actions in ego- centric videos","venue":null,"work_id":"759b2f5a-2951-4561-80b3-63cef2c1e4c2","year":2023},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.736617Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:d4388d98304f7de2b83f75bdb10d675c8a373f710a5c40e54eaa3df857c5f94c","observation_id":"7cd8b596-8223-4b2a-a5e4-5003dea88cea","resolution":{"observed_at":"2026-08-06T21:53:07.703910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:59.832187Z","title":"You only look once: Unified, real-time object de- tection","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.832187Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:f7519d979c52e726ea08c4d29a26a338f2a933644c355cd3aa30fdbc13bbf69f","observation_id":"d160e83d-f8e2-4f1a-887e-ef62cb617543","resolution":{"observed_at":"2026-08-06T21:52:59.832187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:59.922852Z","title":"Action sensitivity learning for temporal action localization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.922852Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:0d7f7864b3ae7c200784c94187c2fb1fba2d784046f2a280a613c152966187d0","observation_id":"9b5c229e-e276-4ca3-91a4-bba32b5d3587","resolution":{"observed_at":"2026-08-06T21:52:59.922852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05590","last_updated":"2023-09-11T16:17:50Z","snapshot_observed_at":"2026-07-06T16:17:00.299422Z","submitted_at":"2023-09-11T16:17:50Z","title":"Temporal Action Localization with Enhanced Instant Discriminability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05590","snapshot_observed_at":"2026-08-06T21:53:00.048092Z","title":"Temporal action localization with enhanced instant discriminability","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.048092Z"},"links":{"cited_paper":"/paper/2309.05590","citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:03295ea1730a2d0115396c1023bb37f3aa2ee9938ac66856f6fa7c2c4e66f2eb","observation_id":"e4f8db01-5425-4c93-b34b-101ce7945aec","resolution":{"observed_at":"2026-08-06T21:53:00.048092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:07.309927Z","title":"Tridet: Temporal action detection with relative boundary modeling","venue":null,"work_id":"e47dc280-3aad-47e8-ad53-d1a69d04677f","year":2023},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.153296Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:fc170deb377a57b33a2eacb95cdfe7717ebc33d25c04a0d19e1d41512fc46617","observation_id":"6f57e020-44bd-4943-8662-b77ad44fd57b","resolution":{"observed_at":"2026-08-06T21:53:07.463989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:06.967128Z","title":"Re- laxed transformer decoders for direct action proposal gener- ation","venue":null,"work_id":"ecd33800-81d2-459f-8487-0d5c2a73b3d1","year":2021},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.248074Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:90df3b48eed50626d89c1b7a9f4a633dd6443e5b0e83f0c1e284aa510972a004","observation_id":"022467a2-d6ab-4a35-9887-f852a27e4e6e","resolution":{"observed_at":"2026-08-06T21:53:07.134101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:06.654667Z","title":"Audio-visual event localization in unconstrained videos","venue":null,"work_id":"f6e9315c-c302-4e22-a208-8ed85e1b3fe6","year":2018},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.340814Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:a3ba75d452aef988a32bd6b482bd0cff995295ccad4fad51175207c7b7171c6f","observation_id":"3a408326-4418-43bf-9b67-396df641f1d3","resolution":{"observed_at":"2026-08-06T21:53:06.791765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:06.358937Z","title":"Deep learning-based action detection in untrimmed videos: A survey.IEEE Transactions on Pattern Analysis and Machine Intelligence , 45(4):4302– 4320, 2022","venue":null,"work_id":"dbea925e-d96e-44bc-ab22-8f6677826c5a","year":2022},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.491979Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:83c98ca6b034f5870565060b963909065c8c3e9926d783d5dd48d1edc7141450","observation_id":"0dd7ef7a-81b6-4b5e-a317-d1eabb452cf0","resolution":{"observed_at":"2026-08-06T21:53:06.518398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:06.036704Z","title":"You only hear once: a yolo-like algorithm for audio segmentation and sound event detection","venue":null,"work_id":"ac352525-1a2c-4ab6-adc5-d197301ac5a9","year":2022},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.581690Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:8f3589d42a1e2ced8cbbf832da19d2091a3cb0587e25c6a699665b8d6e429ab9","observation_id":"98b04cc2-17fc-4d29-882b-6bf07547d5c8","resolution":{"observed_at":"2026-08-06T21:53:06.182668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.12043","last_updated":"2021-05-25T16:22:12Z","snapshot_observed_at":"2026-07-06T11:12:38.080301Z","submitted_at":"2021-05-25T16:22:12Z","title":"Temporal Action Proposal Generation with Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.12043","snapshot_observed_at":"2026-08-06T21:53:00.679239Z","title":"Temporal action proposal generation with transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.679239Z"},"links":{"cited_paper":"/paper/2105.12043","citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:29716ef788eb9a45eddb8fcf00617e89eaf7a07625bb51fdff82c102b8cbcdae","observation_id":"7d18d4f0-4ac5-40a9-bb98-6fa3bfae5bf0","resolution":{"observed_at":"2026-08-06T21:53:00.679239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:05.819999Z","title":"Rcl: Recurrent continuous localization for temporal action detec- tion","venue":null,"work_id":"8d1b5707-d844-48bb-9031-9b5a88ad2a38","year":null},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.753442Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:ee922714502fdb997e2d2f36bbad65e9b69f82a2a6d76d4d9516cf2b6cb4d9bf","observation_id":"f8281b68-9c52-4f7c-b270-0664967836d9","resolution":{"observed_at":"2026-08-06T21:53:05.894285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:05.615946Z","title":"Internvideo2: Scaling foundation models for mul- timodal video understanding","venue":null,"work_id":"1d2932e1-a515-44fa-a27b-fd225afc72cf","year":2024},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.861896Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:9e5dcb9f71b5752c962928a943a4e08c87792176514483c7ee172caaa814abb9","observation_id":"782a3c0a-83ca-4af2-a2aa-a91be51477db","resolution":{"observed_at":"2026-08-06T21:53:05.706511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:05.427023Z","title":"An efficient spatio-temporal pyramid transformer for action detection","venue":null,"work_id":"0d3e7663-117f-402a-82fb-d98583e57a26","year":2022},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.939127Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:ac09f6d023d59d227cd337fae26148daed9c9d4754221d4ab0237d636f0ed85d","observation_id":"75eb99e0-c396-48bb-8d86-7d12f6842739","resolution":{"observed_at":"2026-08-06T21:53:05.526823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:01.011214Z","title":"Dual attention matching for audio-visual event localization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.011214Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:d5d7ab841443211d27fd095de21d41fd854d5b2879ca2261abda2cbc17d7a0ed","observation_id":"e2ea7e57-8730-4fd1-b28f-78e1db40ad0e","resolution":{"observed_at":"2026-08-06T21:53:01.011214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:05.139404Z","title":"Dual relation network for temporal action localization","venue":null,"work_id":"a785318d-286d-4cd3-a1f3-694b183112a1","year":2022},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.089484Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:4ad025ca055ac72911dc2e0b0e2661981c9a2f9f27a303dddd3a10130e76242d","observation_id":"ac19a1c4-9689-4c5a-9d93-259124fe18b1","resolution":{"observed_at":"2026-08-06T21:53:05.267675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:04.812025Z","title":"Learning to refactor action and co-occurrence fea- tures for temporal action localization","venue":null,"work_id":"2a45e9fb-ddc5-483d-8612-6e9adb51ed3b","year":2022},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.205808Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:f8f76f96885364adfdc4a57b5feb276b5b9db3096ae5fe44716eda12bc555ccb","observation_id":"91a4d0c6-7b42-4adf-85ea-1b8476481198","resolution":{"observed_at":"2026-08-06T21:53:04.930022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08740","last_updated":"2020-03-09T00:50:19Z","snapshot_observed_at":"2026-07-06T08:52:26.716343Z","submitted_at":"2020-01-23T18:59:46Z","title":"Audiovisual SlowFast Networks for Video Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08740","snapshot_observed_at":"2026-08-06T21:53:01.288755Z","title":"Audiovisual slowfast networks for video recognition","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.288755Z"},"links":{"cited_paper":"/paper/2001.08740","citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:651a653fcf29428f8553a116cd8f4aa4316f739a8b2e9f50897facabb04d0102","observation_id":"eeeb6297-1c94-4403-b82a-165461958cee","resolution":{"observed_at":"2026-08-06T21:53:01.288755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:04.481427Z","title":"G-tad: Sub-graph localization for tempo- ral action detection","venue":null,"work_id":"36826a0e-2a67-4ac9-a101-f7822c4cefa5","year":2020},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.409621Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:30e00a9fcba05ed851520274320d4beefad6086d131b3f62426707ab59bc43c7","observation_id":"f2d36044-0dc2-4d7f-bd5c-48f4b73bdce9","resolution":{"observed_at":"2026-08-06T21:53:04.649130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:04.133260Z","title":"Audio-visual event localization by learning spatial and semantic co-attention","venue":null,"work_id":"8494d61b-f767-481f-8dfd-5338ad87c768","year":2021},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.497261Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:4b79e3a3873c4084a3f9a5819818961291d69c9c200756d0c0ac382e2a8338bf","observation_id":"ace9aa87-5799-4b7e-a854-2a1df9253e52","resolution":{"observed_at":"2026-08-06T21:53:04.300311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:04.032131Z","title":"Temporal pyramid network for action recognition","venue":null,"work_id":"91e10104-fb3e-4a58-9723-f5d15b0eb6e3","year":2020},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.572693Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:463c12822670daca00c0ae3f3a9720146083530bb54f2c7b03b942da7256c53c","observation_id":"98644f61-cfbb-4f39-b9fd-1f9d39f146d3","resolution":{"observed_at":"2026-08-06T21:53:04.087532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:03.904896Z","title":"Revisiting anchor mechanisms for temporal ac- tion localization","venue":null,"work_id":"67a09bfe-de04-44eb-9942-b10bddba843e","year":2020},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.667259Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:f64e3181f711ae09b0e59afdce7ddcb7208d223eec87a6dcf18f5c064c62df44","observation_id":"3e4f63c9-fc4c-4de1-b7bc-31f74b47d100","resolution":{"observed_at":"2026-08-06T21:53:03.961697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:03.792070Z","title":"Mpn: Multimodal parallel network for audio-visual event localization","venue":null,"work_id":"c6dffe19-6fbf-4348-9d1e-da2b7bc89cb1","year":2021},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.739029Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:b8fc0197561e9755c27b33aaed954e7b05b971cc42fcf5bacc163208526a7983","observation_id":"da56df42-9e95-4be0-ae0e-8dd3e2543d4c","resolution":{"observed_at":"2026-08-06T21:53:03.839549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:03.682012Z","title":"Mm-pyramid: Multimodal pyramid attentional network for audio-visual event localization and video pars- ing","venue":null,"work_id":"0d453844-4e7c-4b79-bb1d-6703b436db8a","year":2022},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.822512Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:eef95a0dff94d61c055fe01c63bc618bd5bdb91ab6c4156df19d589bf212f019","observation_id":"eec95379-296b-495c-a05a-27b0704c6cfc","resolution":{"observed_at":"2026-08-06T21:53:03.739506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:03.597703Z","title":"Graph con- volutional networks for temporal action localization","venue":null,"work_id":"bd0c40a0-19a7-43ac-9b40-2e84bc3c04b6","year":2019},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.887537Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:4f48b9d66c9acf5a202c05df527924a122466d6ead598f4c0292656be1fe9f1b","observation_id":"d9106c28-a30f-4748-a608-e214a731aa28","resolution":{"observed_at":"2026-08-06T21:53:03.628158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:01.984274Z","title":"Actionformer: Lo- calizing moments of actions with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.984274Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:27dddf9f631d3634f309f2319ee9b8d8359caaf31edc26fc8a64e2c251821b83","observation_id":"ee01785a-809a-4097-9844-f5cb33925766","resolution":{"observed_at":"2026-08-06T21:53:01.984274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:03.474162Z","title":"Video self- stitching graph network for temporal action localization","venue":null,"work_id":"9214bee5-8007-4a33-a046-bfc8dd089e96","year":2021},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.073232Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:ff95794a35045ef63a165adb254abea7e87a4bff83829d509de09fc96fe6aed8","observation_id":"d8015066-5343-4a61-a764-7c223f5fe782","resolution":{"observed_at":"2026-08-06T21:53:03.522826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:03.371951Z","title":"Bottom-up temporal action localization with mutual regularization","venue":null,"work_id":"047fc9fa-c7b9-4b5f-8cf7-ff756ebb0379","year":2020},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.139404Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:f8a665a14f5daea4f9c74c555445eddcef966eda3c2b43fa048b09c952fac9b7","observation_id":"b311c305-b820-4278-8bce-a976fe78e285","resolution":{"observed_at":"2026-08-06T21:53:03.412100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:03.231871Z","title":"Enriching local and global contexts for temporal action localization","venue":null,"work_id":"8a763c65-c6b8-49ac-8dc4-f2afa0a299f0","year":2021},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.210024Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:dcff1c1612ba887b7d9c4993409db0e5353f53ffc9b236b23e70b4c74d3bd461","observation_id":"25fc7dc9-2928-4cbc-b6dd-d57993c85d7b","resolution":{"observed_at":"2026-08-06T21:53:03.286231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:03.100694Z","title":"Our code provides further information","venue":null,"work_id":"89f7d150-c110-42f5-83a0-3b4592675a7c","year":null},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.296518Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:fb13d352624e070b5dd4decac94a4da92cc6ad704ca8412af7dc652c65c070f0","observation_id":"9b8f3925-1ac2-4f58-af5d-74b122c37715","resolution":{"observed_at":"2026-08-06T21:53:03.160024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:02.983334Z","title":"Performance was measured us- ing mAP@[0.5:0.05:0.95], along with the average mAP","venue":null,"work_id":"06ada1ea-4a21-4b28-b3b0-66e4633ea73c","year":null},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.400314Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:91c91650d0d5e3816fd59c418ef1500105a52efcdf6eddd2dd5269c63e2506e5","observation_id":"bbc44088-7e4e-420f-a1c0-02c4353f1649","resolution":{"observed_at":"2026-08-06T21:53:03.035271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:02.880197Z","title":"This approach ensures greater feature consis- tency across different temporal resolutions, ultimately im- proving the regression of an event’s location","venue":null,"work_id":"ad04953b-893a-4000-9170-49ea7bf27c5f","year":null},"citing_paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.484752Z"},"links":{"citing_paper":"/paper/2506.23196"},"observation_digest":"sha256:67752ca0f28ce5bc1b33a9c84fc4eeb587ac176c0ef3cee4426c708438bd0096","observation_id":"cda74189-f55c-4927-a1f0-11c380a57b4c","resolution":{"observed_at":"2026-08-06T21:53:02.924236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.23196","last_updated":"2025-06-29T11:50:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:45:24.829695Z","submitted_at":"2025-06-29T11:50:19Z","title":"DEL: Dense Event Localization for Multi-modal Audio-Visual Understanding"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":1,"verified_fuzzy":49},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 1 inbound Pith citation observation for arXiv:2506.23196."}