{"as_of":"2026-08-07T16:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a231157f83ffc44b94dc7b42b099e9f4c2878ec6741268840fae7598694d7931","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:58:06.771420Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T08:40:53.734483Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T03:06:19.435608Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"cited_work":{"arxiv_id":"2507.01384","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01384","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mug: Pseudo labeling augmented audio-visual mamba network for audio-visual video parsing","venue":null,"work_id":"b8deb272-11b6-48ac-9411-0c54213cf563","year":2025},"citing_paper":{"arxiv_id":"2605.08723","last_updated":"2026-05-09T06:13:27Z","snapshot_observed_at":"2026-07-06T23:20:57.084438Z","submitted_at":"2026-05-09T06:13:27Z","title":"EAR: Enhancing Uni-Modal Representations for Weakly Supervised Audio-Visual Video Parsing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T03:03:13.496634Z"},"links":{"cited_paper":"/paper/2507.01384","citing_paper":"/paper/2605.08723"},"observation_digest":"sha256:7d5830debb6684cfeac40de7d41926a9721546f028a4f44cb2986a7e80fd4848","observation_id":"fbc685ee-a8fd-4b6e-bbc9-03e16cefc264","resolution":{"observed_at":"2026-05-12T03:06:19.437712Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01384","snapshot_observed_at":"2026-07-11T18:34:29.549966Z","title":"Mug: Pseudo labeling augmented audio-visual mamba network for audio- visual video parsing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04498","last_updated":"2026-07-26T17:52:57Z","snapshot_observed_at":"2026-08-05T00:22:05.736908Z","submitted_at":"2026-07-05T20:51:24Z","title":"UniSkip-Mamba: A Frequency-Aware State Space Model for Audio-Visual Temporal Forgery Localization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T18:34:29.549966Z"},"links":{"cited_paper":"/paper/2507.01384","citing_paper":"/paper/2607.04498"},"observation_digest":"sha256:29a27f654dc2468c9e80f5a5a18f606f879d64ee4d6ad0db9ff66e5312eece26","observation_id":"23fc593e-51da-478f-b991-062c5c2beefc","resolution":{"observed_at":"2026-07-11T18:34:29.549966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01384","snapshot_observed_at":"2026-08-02T08:40:53.734483Z","title":"Mug: Pseudo labeling augmented audio-visual mamba network for audio- visual video parsing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04498","last_updated":"2026-07-26T17:52:57Z","snapshot_observed_at":"2026-08-05T00:22:05.736908Z","submitted_at":"2026-07-05T20:51:24Z","title":"UniSkip-Mamba: A Frequency-Aware State Space Model for Audio-Visual Temporal Forgery Localization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T08:40:53.734483Z"},"links":{"cited_paper":"/paper/2507.01384","citing_paper":"/paper/2607.04498"},"observation_digest":"sha256:a183944ee33c81445fa53b33e81bf3ec21f45b741ccb8dee73e78f1008a2ceda","observation_id":"20d44590-0dd1-45c2-81d0-6b1c111972b9","resolution":{"observed_at":"2026-08-02T08:40:53.734483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.01384/citation-record","integrity":"/paper/2507.01384/integrity","json":"/paper/2507.01384/citation-record.json","paper":"/paper/2507.01384"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2004.10934","last_updated":"2020-04-23T02:10:02Z","snapshot_observed_at":"2026-07-06T09:14:32.318388Z","submitted_at":"2020-04-23T02:10:02Z","title":"YOLOv4: Optimal Speed and Accuracy of Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.10934","snapshot_observed_at":"2026-08-06T20:58:01.906010Z","title":"Yolov4: Optimal speed and accuracy of object detection","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:01.906010Z"},"links":{"cited_paper":"/paper/2004.10934","citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:005e381a08c2e53d6ff216dea1b0e43803e90df3870ace4e819800694f9d4a5b","observation_id":"f1524d88-db8c-4eec-8bb6-9e54b618e48e","resolution":{"observed_at":"2026-08-06T20:58:01.906010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:11.732034Z","title":"Cm-pie: Cross-modal perception for interactive-enhanced audio-visual video pars- ing","venue":null,"work_id":"ae225c61-109b-4098-b4a8-7596a39176f0","year":2024},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:02.010610Z"},"links":{"citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:ad88cfa29a9164c7f99b14d37cd22e6503a3dc0376fbe0d221fae62be9cc0723","observation_id":"19f18f19-6993-46cf-b4d7-94b87ebe26a6","resolution":{"observed_at":"2026-08-06T20:58:11.863548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:11.440463Z","title":"Joint-modal label denois- ing for weakly-supervised audio-visual video parsing","venue":null,"work_id":"a534764b-b72f-459c-83b3-627e28cf96ba","year":2022},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:02.075272Z"},"links":{"citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:0ed04a432e4e251464f16b3e0e193df5b9d6d1b88634164aaa155058454f2033","observation_id":"cf45796f-a654-4725-807c-735e07bcc76c","resolution":{"observed_at":"2026-08-06T20:58:11.570835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:11.226649Z","title":"Autoaugment: Learning augmentation strategies from data","venue":null,"work_id":"541a14b8-c1fb-4eb2-84c6-6fb0ec50b0a7","year":2019},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:02.118701Z"},"links":{"citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:017f0a8bbf6e9ba41dabe605ef184484b1a0b8cd325d9c62d04f5fbdb8c1cdc8","observation_id":"560c4621-b056-414b-a676-215b7a3ed103","resolution":{"observed_at":"2026-08-06T20:58:11.340473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:02.188493Z","title":"Randaugment: Practical automated data augmen- tation with a reduced search space","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:02.188493Z"},"links":{"citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:04ab4db7a7f218736b16dea36659a0e93ad999ff5738a5c13c6af01e139e8206","observation_id":"2c8e5958-95e2-4ba1-bbc2-991294eacc14","resolution":{"observed_at":"2026-08-06T20:58:02.188493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-06T20:58:02.255554Z","title":"Transformers are ssms: General- ized models and efficient algorithms through structured state space duality","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:02.255554Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:2dd158bfe4dcf3aa30259e35ecc1822cbda911c6930b0ba5f2c27ccdb5a75c64","observation_id":"452e0cba-d5f6-4472-bb85-350eb5a0da76","resolution":{"observed_at":"2026-08-06T20:58:02.255554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T20:58:02.359791Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:02.359791Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:2b2329ebed93d93fd9a0c3a4c369364dd9de2a694efe2f94b9d2c1841a1e8bf9","observation_id":"ce5ceb2c-df9c-4c00-9e7b-463252d0f3dd","resolution":{"observed_at":"2026-08-06T20:58:02.359791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:10.921260Z","title":"Cross-modal prompts: Adapting large pre- trained models for audio-visual downstream tasks","venue":null,"work_id":"df376743-20c9-4e53-b28f-6f0001c55f2b","year":2024},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:02.464731Z"},"links":{"citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:8721f92b17c30b94ef238ecc6b5680f142c6893cb046fe1033c6968e9bbe1bf0","observation_id":"5aeec829-a26a-4c11-8b4a-a7640cf62ed5","resolution":{"observed_at":"2026-08-06T20:58:11.081426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:10.726198Z","title":"Revisit weakly-supervised audio-visual video parsing from the lan- guage perspective","venue":null,"work_id":"4b5e697d-2a67-42b2-beac-e0a0e4d8c02d","year":2024},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:02.567430Z"},"links":{"citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:7872210b41e25d55247d018580abad451bdb64ebce0ae4d0daffc658757b976f","observation_id":"226553c4-125e-47df-b314-b453fcafac38","resolution":{"observed_at":"2026-08-06T20:58:10.846932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:10.448742Z","title":"Col- lecting cross-modal presence-absence evidence for weakly- supervised audio-visual event perception","venue":null,"work_id":"7bdbb353-0d28-4642-b5a1-c811b38a3510","year":2023},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:02.639069Z"},"links":{"citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:eefc168730512b081366ee4777e46242334cf67998a7b7be31f83d3f84b06313","observation_id":"73015c3d-b739-4224-aefc-aaec94e1dfbb","resolution":{"observed_at":"2026-08-06T20:58:10.607106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07810","last_updated":"2025-01-14T03:20:20Z","snapshot_observed_at":"2026-07-06T20:20:42.084970Z","submitted_at":"2025-01-14T03:20:20Z","title":"AVS-Mamba: Exploring Temporal and Multi-modal Mamba for Audio-Visual Segmentation","version":1},"cited_work":{"arxiv_id":"2501.07810","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.07810","snapshot_observed_at":"2026-08-06T20:58:08.024080Z","title":"AVS-Mamba: Exploring Temporal and Multi-modal Mamba for Audio-Visual Segmentation","venue":"cs.CV","work_id":"74bd462b-df74-404f-95d9-b505da3f944f","year":2025},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:02.742986Z"},"links":{"cited_paper":"/paper/2501.07810","citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:756991c0bd111244ed2181e55dfbbcdb1b7221fe774b166da602cb71d5654ec8","observation_id":"ced513ac-8747-43e7-a380-f0e0a33944b9","resolution":{"observed_at":"2026-08-06T20:58:08.144148Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6572","last_updated":"2015-03-20T20:19:16Z","snapshot_observed_at":"2026-07-06T04:04:16.777653Z","submitted_at":"2014-12-20T01:17:12Z","title":"Explaining and Harnessing Adversarial Examples","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6572","snapshot_observed_at":"2026-08-06T20:58:02.882381Z","title":"Explaining and harnessing adversarial examples","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:02.882381Z"},"links":{"cited_paper":"/paper/1412.6572","citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:a393acf2ab1231d9cbf47fbef46073e15690f9f239a7247ead4cf9692e18bc91","observation_id":"1a739b27-4492-43ed-a0f6-645d7774e92b","resolution":{"observed_at":"2026-08-06T20:58:02.882381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-06T20:58:02.986186Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:02.986186Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:5aef2f892bcc04036c3a7f1f490757ce11471e6308f15a2c6b2ea79a8228eb87","observation_id":"151aea69-dc35-4d0a-a214-421f773f98c9","resolution":{"observed_at":"2026-08-06T20:58:02.986186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-08-06T20:58:03.089617Z","title":"Efficiently modeling long sequences with structured state spaces","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:03.089617Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:6642d84d064d9dadf139f329585d2b1cfdb6edce3d691ec223bfb388c17840d4","observation_id":"bec3576d-f24e-49b7-bed3-54c3068c74da","resolution":{"observed_at":"2026-08-06T20:58:03.089617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:10.271382Z","title":"Combining recurrent, convolutional, and continuous-time models with linear state space layers","venue":null,"work_id":"a02019ad-5d9f-432a-90c0-194add2fe42c","year":2021},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:03.194398Z"},"links":{"citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:9203fbb7f27470e2c0279564ae02063bceb297ccc7eedb015c2c02ce6d5bcc99","observation_id":"f9d2b1b8-0d15-4049-857e-bb6fea2968ad","resolution":{"observed_at":"2026-08-06T20:58:10.324169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.12951","last_updated":"2022-09-26T18:37:13Z","snapshot_observed_at":"2026-08-04T19:36:27.363097Z","submitted_at":"2022-09-26T18:37:13Z","title":"Liquid Structural State-Space Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.12951","snapshot_observed_at":"2026-08-06T20:58:03.300791Z","title":"Liquid structural state-space models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:03.300791Z"},"links":{"cited_paper":"/paper/2209.12951","citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:a312f80ba305d938d91c12af1acf05e0d7459800c6a4c37fd1356e8e44da2b56","observation_id":"0b33f58f-cfac-4ef9-93c0-2674aa8c290d","resolution":{"observed_at":"2026-08-06T20:58:03.300791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08083","last_updated":"2025-03-25T17:54:37Z","snapshot_observed_at":"2026-08-06T23:38:21.068023Z","submitted_at":"2024-07-10T23:02:45Z","title":"MambaVision: A Hybrid Mamba-Transformer Vision Backbone","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08083","snapshot_observed_at":"2026-08-06T20:58:03.377920Z","title":"Mambavision: A hy- brid mamba-transformer vision backbone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:03.377920Z"},"links":{"cited_paper":"/paper/2407.08083","citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:9e770925ddd4ddf6e943c367b33b45f88d1353000f4a60877ac0715a5370b058","observation_id":"d2e70f55-3791-4d6a-afba-899058713594","resolution":{"observed_at":"2026-08-06T20:58:03.377920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:03.489721Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:03.489721Z"},"links":{"citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:62279d2e322450f20818df7a06d597ce25134cf9430f6710eef9265b66714cd8","observation_id":"e2dc4534-61f6-4fe7-bdc7-f9fd3e26e966","resolution":{"observed_at":"2026-08-06T20:58:03.489721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02781","last_updated":"2020-02-17T06:16:13Z","snapshot_observed_at":"2026-07-06T08:42:24.926713Z","submitted_at":"2019-12-05T18:18:10Z","title":"AugMix: A Simple Data Processing Method to Improve Robustness and Uncertainty","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02781","snapshot_observed_at":"2026-08-06T20:58:03.569426Z","title":"Augmix: A simple data processing method to improve robustness and uncertainty","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:03.569426Z"},"links":{"cited_paper":"/paper/1912.02781","citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:6c8330f7579cec76b9284630fd89b8511af269fc81fa5e134007069ef3b6976b","observation_id":"27fe4404-ecc1-4c00-ae4b-1174922e344c","resolution":{"observed_at":"2026-08-06T20:58:03.569426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:10.095724Z","title":"Cnn archi- tectures for large-scale audio classification","venue":null,"work_id":"3ea7647d-51e5-4671-a15d-2e3969e6dceb","year":2017},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:03.698324Z"},"links":{"citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:18905cafd6674742fa8702301a5b10ab359c2520a635293a7873f9ab4907cac6","observation_id":"89cb7c1d-36e9-4b82-abe0-ebb6b891b01d","resolution":{"observed_at":"2026-08-06T20:58:10.188755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09338","last_updated":"2024-03-14T12:32:40Z","snapshot_observed_at":"2026-08-06T04:08:34.950441Z","submitted_at":"2024-03-14T12:32:40Z","title":"LocalMamba: Visual State Space Model with Windowed Selective Scan","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09338","snapshot_observed_at":"2026-08-06T20:58:03.812866Z","title":"Localmamba: Visual state space model with windowed selective scan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:03.812866Z"},"links":{"cited_paper":"/paper/2403.09338","citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:db3653fd17142e1ec4a4cdb262196dbc96776b82b7a185c1e63dd1a6f716d65d","observation_id":"8e53fcd3-3a9c-4f42-96a6-e519130c7bcc","resolution":{"observed_at":"2026-08-06T20:58:03.812866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:09.968460Z","title":"Learning tem- porally invariant and localizable features via data augmenta- tion for video recognition","venue":null,"work_id":"30a90438-e7a0-438e-971c-6515e95a5efd","year":2020},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:03.907929Z"},"links":{"citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:1534838a354d8a1a5b355667bea75567bd24c4852b4ddc74c193413f6ec93ef2","observation_id":"9301dcee-7cf8-4901-b4b6-acc4378b16f5","resolution":{"observed_at":"2026-08-06T20:58:10.027441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:09.841731Z","title":"Modality-independent teachers meet weakly-supervised audio-visual event parser","venue":null,"work_id":"bc7227f6-232b-4f9b-a695-5a5a8a03440a","year":2023},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:04.022837Z"},"links":{"citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:85618306c4d60a64aed3a3c62ee32a29ff9eb97ef74b87bc2d599be5d22b6862","observation_id":"48ceaf10-62c6-4f91-9ae6-f2f7892359f4","resolution":{"observed_at":"2026-08-06T20:58:09.899372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18014","last_updated":"2024-05-29T05:19:15Z","snapshot_observed_at":"2026-07-06T18:21:14.089427Z","submitted_at":"2024-05-28T09:57:03Z","title":"Coupled Mamba: Enhanced Multi-modal Fusion with Coupled State Space Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18014","snapshot_observed_at":"2026-08-06T20:58:04.083548Z","title":"Coupled mamba: Enhanced multi-modal fu- sion with coupled state space model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:04.083548Z"},"links":{"cited_paper":"/paper/2405.18014","citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:5256df80aeaed418b28ded8a13d247e4125f5a2b7a55df298b28809c4322071c","observation_id":"0cc45d7e-b710-426a-8604-a17bb499f518","resolution":{"observed_at":"2026-08-06T20:58:04.083548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-08-06T20:58:04.186913Z","title":"Jamba: A hybrid transformer-mamba language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:04.186913Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:3abc51054dad90289b0e82fcb6301d28a0f8d53638631992bc0a498680d402f2","observation_id":"5e794d33-65de-4e8c-96bf-bd59dadc2849","resolution":{"observed_at":"2026-08-06T20:58:04.186913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:09.736196Z","title":"Vmamba: Visual state space model","venue":null,"work_id":"4735a035-3a2e-4878-be31-edf24339793e","year":2024},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:04.291318Z"},"links":{"citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:7dba723d1b4764fe4c1abaa5587c7a90099dd104f8ea216c78ed415f06762b72","observation_id":"ef5608eb-864b-42fd-8792-7251e2f8cf24","resolution":{"observed_at":"2026-08-06T20:58:09.775664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:04.394262Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:04.394262Z"},"links":{"citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:b87e75dcd8e05a847e0c3fa4c42e93c86665cefcb5cf8b7e7b3a7cfa5785daa5","observation_id":"65adcd42-ccc8-4f29-a9ab-0883e487c2f5","resolution":{"observed_at":"2026-08-06T20:58:04.394262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08827","last_updated":"2024-12-29T07:59:42Z","snapshot_observed_at":"2026-07-06T19:01:36.868186Z","submitted_at":"2024-08-16T16:22:34Z","title":"RGBT Tracking via All-layer Multimodal Interactions with Progressive Fusion Mamba","version":2},"cited_work":{"arxiv_id":"2408.08827","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.08827","snapshot_observed_at":"2026-08-06T20:58:07.616493Z","title":"RGBT Tracking via All-layer Multimodal Interactions with Progressive Fusion Mamba","venue":"cs.CV","work_id":"b30fb0cc-6a20-4412-bfe9-bd083d83232d","year":2024},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:04.499289Z"},"links":{"cited_paper":"/paper/2408.08827","citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:b3264599a68629f5632418b70eb4a81221739fce967bd48fce50958264ff54eb","observation_id":"e6c89b0a-ea2d-470f-b872-c34fa8f808a7","resolution":{"observed_at":"2026-08-06T20:58:07.739579Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:09.597534Z","title":"Multi-modal grouping network for weakly-supervised audio-visual video parsing","venue":null,"work_id":"ceda45d3-351f-4492-a342-a678dced578b","year":2022},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:04.636366Z"},"links":{"citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:9cbb06c59e20bd6ba70acf94f6acc4f21eabb7c3e36ab14f1bceee1bda228683","observation_id":"38faa884-73fb-4956-a11e-51faa5c0e065","resolution":{"observed_at":"2026-08-06T20:58:09.666464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:04.777248Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:04.777248Z"},"links":{"citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:ab3d6ff32cdcd75d817d27128f42a03d312c90f34cb6a134ff8e9e9b2466f5aa","observation_id":"9c56607c-b636-4ffe-b403-bee1d4f7e3a3","resolution":{"observed_at":"2026-08-06T20:58:04.777248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:09.464093Z","title":"Coleaf: A contrastive-collaborative learning framework for weakly supervised audio-visual video pars- ing","venue":null,"work_id":"6c2748cc-d0a2-43ee-a582-cb0f752cc8b0","year":null},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:04.890114Z"},"links":{"citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:4c6b7113daf06603ba5fcfca3468381fc5c0f7482b925180bf801170367b5e1d","observation_id":"655afca1-a5dc-4906-a1e6-e8d47a33df33","resolution":{"observed_at":"2026-08-06T20:58:09.519233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.04933","last_updated":"2023-03-03T18:35:28Z","snapshot_observed_at":"2026-07-06T13:40:19.948018Z","submitted_at":"2022-08-09T17:57:43Z","title":"Simplified State Space Layers for Sequence Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.04933","snapshot_observed_at":"2026-08-06T20:58:04.971510Z","title":"Simplified state space layers for sequence modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:04.971510Z"},"links":{"cited_paper":"/paper/2208.04933","citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:483612abc6b8c3e263a174f08c147a7a19359315026c46ed489fc786f30266d5","observation_id":"655ab876-e5e7-409e-ad01-f5f0d5185dc8","resolution":{"observed_at":"2026-08-06T20:58:04.971510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:05.068195Z","title":"Audio-visual event localization in unconstrained videos","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:05.068195Z"},"links":{"citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:e2a5770eb4dc96c063704dfb2ba9e163c06d5ecebc827f6a2720724d997965b2","observation_id":"94fc1c35-2f04-4555-a62d-7c0d41389f16","resolution":{"observed_at":"2026-08-06T20:58:05.068195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:09.339296Z","title":"Unified mul- tisensory perception: Weakly-supervised audio-visual video parsing","venue":null,"work_id":"e6d26f13-b1c2-43d3-a692-dd4f186adbdd","year":2020},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:05.149955Z"},"links":{"citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:bedf27d6b3838ad9c826c4103d195ac8df81453c28b4ecb3f0c1ae9f2689e8cf","observation_id":"a4ee575d-c746-4e32-8eb6-9f0ad5b9ba5c","resolution":{"observed_at":"2026-08-06T20:58:09.382318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:09.188007Z","title":"Link: Adaptive modality interaction for audio-visual video parsing","venue":null,"work_id":"5c18fe0d-dad2-40a2-8774-6a0c334c726a","year":2025},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:05.255570Z"},"links":{"citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:8be2155a6a7d28ab828011f7ee7442c0f4109cc3a202092a6fada46a7b14f7cd","observation_id":"562c4318-668e-41cf-bfb4-410212aa1dc0","resolution":{"observed_at":"2026-08-06T20:58:09.246132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:09.102818Z","title":"Cbam: Convolutional block attention module","venue":null,"work_id":"f0aedc79-6919-4ed8-b74e-1dbee25aef59","year":2018},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:05.306415Z"},"links":{"citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:92f376aa932bbd02d12b0e4a29a90f7d6a2ba24e7d447a099fa786e599b59ebf","observation_id":"0605fbe7-85df-4b97-94d1-f91383469d89","resolution":{"observed_at":"2026-08-06T20:58:09.136167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:05.398357Z","title":"Exploring heterogeneous clues for weakly-supervised audio-visual video parsing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:05.398357Z"},"links":{"citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:5906470f1c69fce565c75dc9283845410391111ad6a1c6b7bf63c9357869c36d","observation_id":"73efefe9-3b44-43bc-b36b-68bdd364fe6b","resolution":{"observed_at":"2026-08-06T20:58:05.398357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:08.987622Z","title":"Dual attention matching for audio-visual event localization","venue":null,"work_id":"2243bfc7-ddc2-4c63-abd3-ad71fe36b745","year":2019},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:05.478358Z"},"links":{"citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:e589a4519f780f1e8a3168b9d32af67fc1ca72c3f559ac2d0eacc410d1c13e44","observation_id":"9882aed9-e2eb-40e2-b052-e07aff7e68c0","resolution":{"observed_at":"2026-08-06T20:58:09.020659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:05.570892Z","title":"Large-scale con- trastive language-audio pretraining with feature fusion and keyword-to-caption augmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:05.570892Z"},"links":{"citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:9935f4b75f2c33fb7e90bf3e379236f1118f6d88cb455eaf7bdf2a850f774486","observation_id":"1d827604-f9d1-4ab5-a83f-76e170833c64","resolution":{"observed_at":"2026-08-06T20:58:05.570892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09498","last_updated":"2025-02-02T13:57:05Z","snapshot_observed_at":"2026-07-06T18:00:07.537987Z","submitted_at":"2024-04-15T06:37:21Z","title":"FusionMamba: Dynamic Feature Enhancement for Multimodal Image Fusion with Mamba","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09498","snapshot_observed_at":"2026-08-06T20:58:05.643282Z","title":"Fusionmamba: Dy- namic feature enhancement for multimodal image fusion with mamba","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:05.643282Z"},"links":{"cited_paper":"/paper/2404.09498","citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:8d8cadbff4db8a78fa34daa7b7c4cbb85ed7cdd73a736a4f8250bde23be8f34a","observation_id":"5ed0db64-e4dd-4aca-90dd-7496901d27f4","resolution":{"observed_at":"2026-08-06T20:58:05.643282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:08.855716Z","title":"Language- driven all-in-one adverse weather removal","venue":null,"work_id":"a95f5312-c960-49d9-96cf-4a62d87dacf7","year":2024},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:05.718015Z"},"links":{"citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:b1b7e848ce1e655b66cb35d4d3b602659295505001662c0c149bd59413270149","observation_id":"d365f679-fdf1-4cea-b324-81e40585f0ab","resolution":{"observed_at":"2026-08-06T20:58:08.921212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15936","last_updated":"2024-09-24T09:58:07Z","snapshot_observed_at":"2026-07-06T19:21:08.143870Z","submitted_at":"2024-09-24T09:58:07Z","title":"DepMamba: Progressive Fusion Mamba for Multimodal Depression Detection","version":1},"cited_work":{"arxiv_id":"2409.15936","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.15936","snapshot_observed_at":"2026-08-06T20:58:07.307013Z","title":"DepMamba: Progressive Fusion Mamba for Multimodal Depression Detection","venue":"cs.CY","work_id":"d7bb1140-1e2c-45b3-93d6-a73ae14a560d","year":2024},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:05.783727Z"},"links":{"cited_paper":"/paper/2409.15936","citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:2051f1c247c725118c952d5c899f9b311f2bb97e89ed66c9488bb039209376c7","observation_id":"60fd1cc5-0115-4de8-a785-3cadecebb228","resolution":{"observed_at":"2026-08-06T20:58:07.426883Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:08.735205Z","title":"Text-if: Leveraging semantic text guidance for degradation-aware and interactive image fusion","venue":null,"work_id":"ae735a96-ebfe-4f87-8c1e-b8356241f26a","year":2024},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:05.882496Z"},"links":{"citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:e72bc50a1280694a7d4e78624a8d229cd34cb1cc9cd4a9c65efac786b41f9377","observation_id":"d5fd2380-7cf8-4973-af4e-a6605d2aa624","resolution":{"observed_at":"2026-08-06T20:58:08.797355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:08.583421Z","title":"Mm-pyramid: Multimodal pyramid attentional network for audio-visual event localization and video pars- ing","venue":null,"work_id":"850df4e4-88e7-41b6-a8f1-e01860c181dd","year":2022},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:06.030283Z"},"links":{"citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:ad378fae2adf395932a46e959b664a1f2ab2727dc427c2e891036da3a65062d2","observation_id":"3d7ce16a-c48d-4525-aaaf-f072feda7598","resolution":{"observed_at":"2026-08-06T20:58:08.687711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07992","last_updated":"2024-05-20T16:36:21Z","snapshot_observed_at":"2026-07-06T18:13:42.288757Z","submitted_at":"2024-05-13T17:59:56Z","title":"MambaOut: Do We Really Need Mamba for Vision?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07992","snapshot_observed_at":"2026-08-06T20:58:06.156919Z","title":"Mambaout: Do we really need mamba for vision? arXiv preprint arXiv:2405.07992,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:06.156919Z"},"links":{"cited_paper":"/paper/2405.07992","citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:1e8201cfc5f939fac540e38cc42f3fc6303e394d82408d73f6c2a170532cdcd3","observation_id":"8b6998f6-0317-4d24-b6c9-93447fb321da","resolution":{"observed_at":"2026-08-06T20:58:06.156919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:08.348393Z","title":"Cutmix: Regu- larization strategy to train strong classifiers with localizable features","venue":null,"work_id":"4b10fec7-52d3-48bf-abb9-2db2725c0c58","year":2019},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:06.259664Z"},"links":{"citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:37b3d63ecd1ede336edd74bd37e67c1331845c635ea94356d3689b76978b92e1","observation_id":"b0a227d4-5167-4fd2-b780-5e17d58baadf","resolution":{"observed_at":"2026-08-06T20:58:08.453348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.03457","last_updated":"2020-12-07T05:40:33Z","snapshot_observed_at":"2026-08-05T12:14:27.382637Z","submitted_at":"2020-12-07T05:40:33Z","title":"VideoMix: Rethinking Data Augmentation for Video Classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.03457","snapshot_observed_at":"2026-08-06T20:58:06.406992Z","title":"Videomix: Rethinking data augmentation for video classification","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:06.406992Z"},"links":{"cited_paper":"/paper/2012.03457","citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:756125545657fe4590b45b7db378b41a89d3e1716a51e81bdfd71d9c8875f509","observation_id":"9786d213-3270-4def-ba54-3f9774615a9f","resolution":{"observed_at":"2026-08-06T20:58:06.406992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09506","last_updated":"2024-03-25T02:45:35Z","snapshot_observed_at":"2026-07-06T17:44:41.822709Z","submitted_at":"2024-03-14T15:53:04Z","title":"Don't Judge by the Look: Towards Motion Coherent Video Representation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09506","snapshot_observed_at":"2026-08-06T20:58:06.514806Z","title":"Don’t judge by the look: A motion coherent augmenta- tion for video recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:06.514806Z"},"links":{"cited_paper":"/paper/2403.09506","citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:fde34219e2c37aa5a0c92ed177b0d5c8cefbaecda90d377ed35cc937e272daba","observation_id":"ede876a5-9423-4eb5-b7a3-9d0cc4aba866","resolution":{"observed_at":"2026-08-06T20:58:06.514806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08126","last_updated":"2024-07-11T01:57:08Z","snapshot_observed_at":"2026-08-06T08:34:12.599004Z","submitted_at":"2024-07-11T01:57:08Z","title":"Label-anticipated Event Disentanglement for Audio-Visual Video Parsing","version":1},"cited_work":{"arxiv_id":"2407.08126","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.08126","snapshot_observed_at":"2026-08-06T20:58:06.974750Z","title":"Label-anticipated Event Disentanglement for Audio-Visual Video Parsing","venue":"cs.AI","work_id":"e1e894ca-c39e-41d1-b11d-1220ad910ab3","year":2024},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:06.622079Z"},"links":{"cited_paper":"/paper/2407.08126","citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:6a9db97142b9b18eabd79f12dbe2fad1a272326d17af042562ce9fb4f358fb9c","observation_id":"e0ed3644-c223-4aed-be6c-570b4f284f05","resolution":{"observed_at":"2026-08-06T20:58:07.091761Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09417","last_updated":"2024-11-14T02:00:33Z","snapshot_observed_at":"2026-07-06T17:16:59.193820Z","submitted_at":"2024-01-17T18:56:18Z","title":"Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09417","snapshot_observed_at":"2026-08-06T20:58:06.771420Z","title":"Vision mamba: Efficient visual representation learning with bidirectional state space model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:06.771420Z"},"links":{"cited_paper":"/paper/2401.09417","citing_paper":"/paper/2507.01384"},"observation_digest":"sha256:f5d0ea6237c63cff83e9603feee958b122b949bd07497ba751ceb99e45534748","observation_id":"6e9efd3a-ee14-4b9d-96a0-8c80449c38de","resolution":{"observed_at":"2026-08-06T20:58:06.771420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.01384","last_updated":"2025-08-12T16:55:32Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T14:42:45.225538Z","submitted_at":"2025-07-02T06:00:49Z","title":"MUG: Pseudo Labeling Augmented Audio-Visual Mamba Network for Audio-Visual Video Parsing"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":4,"verified_fuzzy":21},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 3 inbound Pith citation observations for arXiv:2507.01384."}