{"as_of":"2026-08-17T19:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d6c795296609675bca2dc433f309fbbf29fc067e17602efdc412cb6f20ba9268","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:59:51.477101Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T02:16:34.307559Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T07:42:06.493920Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"cited_work":{"arxiv_id":"2505.02393","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02393","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2505.02393 , year=","venue":null,"work_id":"53308f1b-9549-4e18-9c92-2130f14cf089","year":null},"citing_paper":{"arxiv_id":"2605.08651","last_updated":"2026-05-09T03:46:39Z","snapshot_observed_at":"2026-08-14T23:03:23.491433Z","submitted_at":"2026-05-09T03:46:39Z","title":"Privacy-Aware Video Anomaly Detection through Orthogonal Subspace Projection","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-12T02:16:34.307559Z"},"links":{"cited_paper":"/paper/2505.02393","citing_paper":"/paper/2605.08651"},"observation_digest":"sha256:21bed5e6894728b18d9e1a2ccbe8e46832efab5b125aef43c0a138b96cd2ccb8","observation_id":"1ab0dc88-9172-430a-b3f3-66b4553ec401","resolution":{"observed_at":"2026-05-12T07:42:06.496671Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.02393/citation-record","integrity":"/paper/2505.02393/integrity","json":"/paper/2505.02393/citation-record.json","paper":"/paper/2505.02393"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:50.911237Z","title":"Vatt: Transformers for multimodal self-supervised learning from raw video, audio and text","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.911237Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:c54ba129623c44f23925ed4e25dda6d4ef71540aea28fd971e59d298d2768adb","observation_id":"6bd819c8-d017-4414-b352-099ae9b0d688","resolution":{"observed_at":"2026-08-16T00:59:50.911237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-08-17T03:00:38.806206Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-16T00:59:50.916418Z","title":"Flamingo: A visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.916418Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:b4b5a7e958d5050a7720c931bfd859a1d02b3b3a717202c29ff2c5de50a6b4ca","observation_id":"113eecb1-bd8d-49d4-8d18-45b79e1e96c5","resolution":{"observed_at":"2026-08-16T00:59:50.916418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:50.921740Z","title":"Synthetic temporal anomaly guided end-to-end video anomaly detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.921740Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:6b45030ca8ad13b4fb579e445b977a7438aebcf9bec4d64624b595afa9e3d08c","observation_id":"9a9596b2-b7bf-40bf-acd0-8af359e3795e","resolution":{"observed_at":"2026-08-16T00:59:50.921740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:50.927300Z","title":"An application-driven survey on event-based neuromorphic computer vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.927300Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:bbacb5cd7520549c1a847288733347882f50b2e5f5313dd840f07842197d918b","observation_id":"77443699-c938-4a42-9bbf-f303fb498f58","resolution":{"observed_at":"2026-08-16T00:59:50.927300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13627","last_updated":"2024-08-27T14:14:51Z","snapshot_observed_at":"2026-08-16T13:24:06.720834Z","submitted_at":"2024-08-24T16:48:25Z","title":"Recent Event Camera Innovations: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13627","snapshot_observed_at":"2026-08-16T00:59:50.932151Z","title":"Recent event camera innovations: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.932151Z"},"links":{"cited_paper":"/paper/2408.13627","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:ea37eec870b6fefc8283aa7bf6718dd00a00ff52ebfded56d5bfc7341b1720ad","observation_id":"ef46194c-47ff-4f10-ba9b-c470f9770bd2","resolution":{"observed_at":"2026-08-16T00:59:50.932151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:50.938712Z","title":"Prompt-enhanced multiple instance learning for weakly supervised video anomaly detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.938712Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:fc9d4a2bc14b7068dd0861bf43269810153bf1ecc0a0ebbfa46fc7ca021cae1e","observation_id":"27a55b22-3743-4689-9c8e-640b5f761ab7","resolution":{"observed_at":"2026-08-16T00:59:50.938712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:50.944623Z","title":"Tevad: Improved video anomaly detection with captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.944623Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:a079c1bd7bc0d42a5b3f6a627a30a182dafc370fb7612a80e35e9e54a436e2f5","observation_id":"de656d75-c0f8-445f-94b9-77106deed9df","resolution":{"observed_at":"2026-08-16T00:59:50.944623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:50.949478Z","title":"Mgfn: Magnitude-contrastive glance-and-focus network for weakly-supervised video anomaly detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.949478Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:078efb5f7cabef1e332e73f75367fc253e34d73beeecb65bdd0290c8033d56a5","observation_id":"aa33d1f5-7850-40ea-a696-5e36f3470cc6","resolution":{"observed_at":"2026-08-16T00:59:50.949478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:50.954439Z","title":"Label-free event-based object recognition via joint learning with image reconstruction from events","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.954439Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:2e3f9f94c4644fec01e0b1221a33511fab8a0da452ebeff54c2d2c9de0574340","observation_id":"bf1c20af-57c9-4225-9c14-854105afcece","resolution":{"observed_at":"2026-08-16T00:59:50.954439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06126","last_updated":"2022-05-12T14:39:21Z","snapshot_observed_at":"2026-08-16T17:00:46.272100Z","submitted_at":"2022-05-12T14:39:21Z","title":"One Model, Multiple Modalities: A Sparsely Activated Approach for Text, Sound, Image, Video and Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.06126","snapshot_observed_at":"2026-08-16T00:59:50.959891Z","title":"One model, multiple modalities: A sparsely 10 activated approach for text, sound, image, video and code","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.959891Z"},"links":{"cited_paper":"/paper/2205.06126","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:089820bb308f35f64a4fc99fa3a5c8c0312c7be66d51381d56ca353721d6d2c9","observation_id":"a11adc1b-a59c-40aa-9628-c3ef04a24ec9","resolution":{"observed_at":"2026-08-16T00:59:50.959891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:53.346202Z","title":"Laplace redux—effortless bayesian deep learning","venue":null,"work_id":"ca8ebf35-c3f4-4a4c-8615-50d802255310","year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.966163Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:43fbfc952a6b5f2029a59873b437e9e51acbf9ead3855beb22948a259b3fc8cf","observation_id":"fb408ac9-7633-40de-a00c-e0e3b99d4cb8","resolution":{"observed_at":"2026-08-16T00:59:53.351397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:53.328388Z","title":"Learnable expansion of graph operators for multi-modal feature fusion, 2025","venue":null,"work_id":"a56a284d-987a-44e6-bd82-31973e81fc1a","year":2025},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.971239Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:990d011e080e8103f14cbcd6b921f59651efd247a3d2ed6bd547c72c7055f8ba","observation_id":"ff68a20b-cbd2-4b0b-b0e3-21d525091025","resolution":{"observed_at":"2026-08-16T00:59:53.333787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-14T18:47:26.721223Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-16T00:59:50.976185Z","title":"Palm-e: An embodied multimodal language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.976185Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:911000240433301c1047a2322060cff29d54842a928f301be4993b8a7cfec862","observation_id":"671655cd-4b97-47e6-a0b9-2afda514283f","resolution":{"observed_at":"2026-08-16T00:59:50.976185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:53.312423Z","title":"Self-supervised video forensics by audio-visual anomaly detection","venue":null,"work_id":"10ecec64-e9f6-47e8-a6e0-9c54e5539254","year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.981445Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:b3c4774778b5a2fec1836c23bc7b6d72a1107cc85bd7abe8c4fe13794893f3ad","observation_id":"33c05f24-6762-4846-94db-a8b44e0084f1","resolution":{"observed_at":"2026-08-16T00:59:53.317424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:50.986469Z","title":"Mist: Multiple instance self-training framework for video anomaly detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.986469Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:3630836ee18ffcb7c56803813a087e81c765dabfdde630e3b73bd359aa8d1b84","observation_id":"626ebc13-bd99-42e4-a6fe-0ed12c58029b","resolution":{"observed_at":"2026-08-16T00:59:50.986469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.13720","last_updated":"2021-07-29T03:07:25Z","snapshot_observed_at":"2026-08-16T18:06:46.150265Z","submitted_at":"2021-07-29T03:07:25Z","title":"Convolutional Transformer based Dual Discriminator Generative Adversarial Networks for Video Anomaly Detection","version":1},"cited_work":{"arxiv_id":"2107.13720","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.13720","snapshot_observed_at":"2026-08-16T00:59:51.954315Z","title":"Convolutional Transformer based Dual Discriminator Generative Adversarial Networks for Video Anomaly Detection","venue":"cs.CV","work_id":"9335db4d-7b87-4551-84e7-3ed9ad3b624b","year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.991777Z"},"links":{"cited_paper":"/paper/2107.13720","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:39bb48341b97626485f47c26d6d59b68ca1ae34dba7ea3e9cabc75d6f2e894b9","observation_id":"20a128ae-b31c-4607-8b47-822c0e462755","resolution":{"observed_at":"2026-08-16T00:59:51.961730Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:53.286140Z","title":"Multimodal motion conditioned diffusion model for skeleton- based video anomaly detection","venue":null,"work_id":"f31a2243-182e-47ed-ba09-bd2481db7c5e","year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:50.997828Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:074b6d0cb1bd24b7913e00f8fcac12adfb356e96067fa4507ad2c1b98371c97e","observation_id":"6c2b8468-659d-41a9-b23a-d1824a6c28ca","resolution":{"observed_at":"2026-08-16T00:59:53.292070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:51.002521Z","title":"Dropout as a bayesian approximation: Representing model uncertainty in deep learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.002521Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:85221b4a0823fa6c2993e048d69861ef6e5e06d0ede3d6201f61c19a542f95be","observation_id":"d643ed1c-0217-40eb-ab9c-d5514b2381ca","resolution":{"observed_at":"2026-08-16T00:59:51.002521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:53.256444Z","title":"Event- based vision: A survey","venue":null,"work_id":"b0ce9433-a783-4c85-9d5e-52a253ef9417","year":2020},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.007483Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:82a98f643df5e5bdb0ce977dcc1d73ae33bc1a8b08aeb9b2514652dfcddd7537","observation_id":"0b6d0d52-5118-4a24-9b5a-15dc38a52a1f","resolution":{"observed_at":"2026-08-16T00:59:53.262118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:53.238330Z","title":"End-to-end learn- ing of representations for asynchronous event-based data","venue":null,"work_id":"8a407750-dfe2-44be-9904-000835b42a8e","year":2019},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.012228Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:6e3d361090f58e58def7eb746ff324379d320999c8d29013e4893ba435b2432a","observation_id":"b8847dee-5757-4b88-8a79-dfcb83ffa515","resolution":{"observed_at":"2026-08-16T00:59:53.244566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:53.221207Z","title":"Anomaly detection in video via self-supervised and multi-task learning","venue":null,"work_id":"9aa7ccde-6ef7-4954-9e27-df80d30a0426","year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.016827Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:4e5c7ba695598fbebb86e96f5ab9c9010502a52d56a99af02714673cc408df64","observation_id":"1873d1f4-c8f5-477f-810e-a3915f189a8c","resolution":{"observed_at":"2026-08-16T00:59:53.226552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20455","last_updated":"2024-12-29T12:46:57Z","snapshot_observed_at":"2026-08-16T12:59:48.157997Z","submitted_at":"2024-12-29T12:46:57Z","title":"Cross-Modal Fusion and Attention Mechanism for Weakly Supervised Video Anomaly Detection","version":1},"cited_work":{"arxiv_id":"2412.20455","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.20455","snapshot_observed_at":"2026-08-16T00:59:51.924744Z","title":"Cross-Modal Fusion and Attention Mechanism for Weakly Supervised Video Anomaly Detection","venue":"cs.CV","work_id":"9ca68b74-5966-47f4-969e-a98d51ce2399","year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.021557Z"},"links":{"cited_paper":"/paper/2412.20455","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:77674dff4a24230093fc0de448b7d287a7ad55699cf739f9c855f76b553acdf2","observation_id":"d646ac88-3b40-4161-8ab2-2d8db07b365b","resolution":{"observed_at":"2026-08-16T00:59:51.930790Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:51.026515Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.026515Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:c34750cf4f1d4d8cd8aef12a8226f5217e647c072151849d302c63e9934557d0","observation_id":"34c822e4-e7e9-4497-a776-6e4857d66fce","resolution":{"observed_at":"2026-08-16T00:59:51.026515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:53.192397Z","title":"Omnivore: A single model for many visual modalities","venue":null,"work_id":"9321cee2-6386-42c0-9a5d-c78a7b572fa7","year":2022},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.031112Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:eca8a1377bda333ab7aeb6539ddf8edc4540befd293244f6ae468ee67c373c84","observation_id":"48adf15d-1297-43fb-8c3e-3bef6efbcc7a","resolution":{"observed_at":"2026-08-16T00:59:53.197635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-08-11T00:52:12.225793Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-16T00:59:51.035716Z","title":"Multimodal chain-of-thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.035716Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:74590d5bca083cfac57399e9d25437121d933a73dc8118434e77da6a444e91f0","observation_id":"6f3f3644-1250-40d8-9c27-06698221c5c9","resolution":{"observed_at":"2026-08-16T00:59:51.035716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:51.040607Z","title":"Deep multimodal representation learning: A survey","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.040607Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:ace22135148636c55d109193be79a2fc771d36408f744ac3d3317d239d9cfe1e","observation_id":"b420b44f-9902-419b-8f71-17cb49a74228","resolution":{"observed_at":"2026-08-16T00:59:51.040607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:53.162262Z","title":"Backprop kf: Learning discriminative deterministic state estimators","venue":null,"work_id":"6cc63eca-8ddc-4cb5-aaf0-a1a57764ea12","year":2016},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.046135Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:73419bf59aa1a94cc146dd6f1dff481899beec818b8add3d18106ca857c83736","observation_id":"ae448456-c312-43ce-b31a-f60105129157","resolution":{"observed_at":"2026-08-16T00:59:53.168753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:51.051613Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.051613Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:f03acba193e37d29cc418329109437bdb69f5c21a9ccebbd64caf04e8957c9f7","observation_id":"ee01b8c1-3e41-4907-a1a3-ef711b6052ff","resolution":{"observed_at":"2026-08-16T00:59:51.051613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.02703","last_updated":"2024-12-16T23:42:56Z","snapshot_observed_at":"2026-08-16T22:45:04.602281Z","submitted_at":"2022-02-06T04:18:45Z","title":"Multi-modal Sensor Fusion for Auto Driving Perception: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.02703","snapshot_observed_at":"2026-08-16T00:59:51.056053Z","title":"Multi-modal sensor fusion for auto driving perception: A survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.056053Z"},"links":{"cited_paper":"/paper/2202.02703","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:455c3d1feaefbf6c07ef6fdace3154fa1eb7460a1c71b6f3f111d40d41d8802b","observation_id":"f76a891d-60ad-4ba8-9643-1438994e8ce9","resolution":{"observed_at":"2026-08-16T00:59:51.056053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:51.061225Z","title":"Attention-based deep multiple instance learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.061225Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:598cbcfd996716104dc5032faec0e2d6329f63081326656afe63fae754c862e5","observation_id":"e019a117-ebb2-4bdd-8fdf-857839c50650","resolution":{"observed_at":"2026-08-16T00:59:51.061225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03093","last_updated":"2025-05-08T09:35:41Z","snapshot_observed_at":"2026-08-13T16:13:34.418795Z","submitted_at":"2024-12-04T07:44:58Z","title":"Expanding Event Modality Applications through a Robust CLIP-Based Encoder","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03093","snapshot_observed_at":"2026-08-16T00:59:51.066336Z","title":"Expanding event modality applications through a robust clip-based encoder","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.066336Z"},"links":{"cited_paper":"/paper/2412.03093","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:18480ab5d5644bd2b089d0b17815a44c4d3cb3c3e38b72ee7c2c3bdd3fda535e","observation_id":"b1a76d88-32eb-425a-a5f0-c9c36982733c","resolution":{"observed_at":"2026-08-16T00:59:51.066336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.08637","last_updated":"2020-12-15T21:59:58Z","snapshot_observed_at":"2026-08-16T18:58:13.593484Z","submitted_at":"2020-12-15T21:59:58Z","title":"Multi-Modal Anomaly Detection for Unstructured and Uncertain Environments","version":1},"cited_work":{"arxiv_id":"2012.08637","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.08637","snapshot_observed_at":"2026-08-16T00:59:51.833500Z","title":"Multi-Modal Anomaly Detection for Unstructured and Uncertain Environments","venue":"cs.RO","work_id":"38a53422-c103-4087-9190-dc0f83dc8cdc","year":2020},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.071784Z"},"links":{"cited_paper":"/paper/2012.08637","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:ad417c1e015028789628feffa2c02f1337340c526ab35253fca0f05f05035b9c","observation_id":"18894592-967a-4be5-a270-6ca595174e2d","resolution":{"observed_at":"2026-08-16T00:59:51.839774Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:51.076712Z","title":"What uncertainties do we need in bayesian deep learning for computer vision? In Advances in Neural Information Processing Systems (NeurIPS), 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.076712Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:35a935b1b91606311c5c7f2057923f2cfec811bef6b63f848660e2daccd61264","observation_id":"d810587e-ed47-43c8-9f5f-e724c2943fc5","resolution":{"observed_at":"2026-08-16T00:59:51.076712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:53.108833Z","title":"N-imagenet: Towards robust, fine-grained object recognition with event cameras","venue":null,"work_id":"86ab4c84-9b32-4414-a2b7-f663864c826e","year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.081711Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:bc34312a5de2b670febbc4681d0ee2e4fc8282e70ac72f27500adc4a300d5a93","observation_id":"05abf839-0e42-4fb3-b8a7-72bf3381445a","resolution":{"observed_at":"2026-08-16T00:59:53.114323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:53.089557Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"1d2aa7e4-65cd-403c-80c2-a828e62d6067","year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.203912Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:f09e8037e6dcebac1905d3078508e122d0ba605784e169f5977db224f63f66fe","observation_id":"e1984fd1-e3b5-4a5f-88d9-3817fffa039a","resolution":{"observed_at":"2026-08-16T00:59:53.095492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:53.066916Z","title":"Align before fuse: Vision and language representation learning with momentum distillation","venue":null,"work_id":"cbf1b74a-dff2-4636-bc2a-37f91960d647","year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.208832Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:49ccd398301c7b8e89340f344d7b9c93ac4617f179d5e9ac62fa1a4f3fcd0793","observation_id":"b7af93cc-28ae-4191-8f5f-acbec588e6ce","resolution":{"observed_at":"2026-08-16T00:59:53.074405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-16T00:59:51.213850Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.213850Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:d74c8bec17cd261779faf30922b772f45bc4c57298a37ce01b34d34fcf314cf7","observation_id":"d496875f-1c6d-4c16-8a9d-d6fbd72f8b6c","resolution":{"observed_at":"2026-08-16T00:59:51.213850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:51.219073Z","title":"A survey of multimodel large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.219073Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:f4853db4d98717936bdaec5197e4f71d5bce90e47adbe97192dbc166f6ee4890","observation_id":"304a29a1-f79c-4620-b731-37325c15f641","resolution":{"observed_at":"2026-08-16T00:59:51.219073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:53.035660Z","title":"A 128×128 120 db 15µs latency asynchronous temporal contrast vision sensor","venue":null,"work_id":"9bfdc826-601a-44c7-82fb-08c19502c0a7","year":2008},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.223820Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:de8ee0a7479e4be0c90c2a9ddfc21cfc643cb0ae0232e856284fecdb64d984f8","observation_id":"d8ec36d6-f727-4da1-a425-2ae8c93204f6","resolution":{"observed_at":"2026-08-16T00:59:53.041423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:51.228503Z","title":"Future frame prediction for anomaly detection–a new baseline","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.228503Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:dd4d910973b8322b380822c946beeb2c80ef60cf41859db3e0657430eecd3d50","observation_id":"033d103b-bc2d-4646-a7f0-3a1c3c4a596f","resolution":{"observed_at":"2026-08-16T00:59:51.228503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.999923Z","title":"Towards multimodal model generalization: Visual-audio temporal alignment for video classification","venue":null,"work_id":"07ef4e3a-e05a-47ef-bd98-a3ce1393573b","year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.233235Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:7d2d3024d80e7d4361d2dbad19afda1e52c4eddf5d1b5273d91ccabb130f9754","observation_id":"c100e42e-b86a-404c-8a77-8b4330fe7051","resolution":{"observed_at":"2026-08-16T00:59:53.011088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.974643Z","title":"Weakly supervised temporal anomaly localization in surveillance videos","venue":null,"work_id":"be4167e2-f8d4-4d0f-baa5-15ea49bfc3bc","year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.238212Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:17e8345ea746bdc0d06632fa6aa0fe747f38ace9ccdbebc9da3d253ffe0da7ee","observation_id":"1573b672-f55d-4395-a84f-3894ff076875","resolution":{"observed_at":"2026-08-16T00:59:52.985040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-16T00:59:51.244654Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.244654Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:ab7e63bfc4a657700ff0649707a71ad19e322c402e3132517eb02bdc9b17fec0","observation_id":"a2e0b421-12e0-4ee8-a65c-8968dab48e8c","resolution":{"observed_at":"2026-08-16T00:59:51.244654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.953634Z","title":"Learning optical flow from event camera with rendered dataset","venue":null,"work_id":"1f413765-2660-4e9c-842b-88fb4bf82891","year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.250065Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:f0623afe5c4e01f887f9602039bb98aa21a4ce4830ee5103f7da23627b557b37","observation_id":"260a2878-4efa-4630-a13b-dd34b1db2ae0","resolution":{"observed_at":"2026-08-16T00:59:52.960966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05702","last_updated":"2024-01-11T07:09:44Z","snapshot_observed_at":"2026-08-16T14:28:20.065688Z","submitted_at":"2024-01-11T07:09:44Z","title":"Video Anomaly Detection and Explanation via Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05702","snapshot_observed_at":"2026-08-16T00:59:51.254940Z","title":"Video anomaly detection and explanation via large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.254940Z"},"links":{"cited_paper":"/paper/2401.05702","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:e3ed4dec7ab01e64cd6e783c2b87ddba3078a60689e5bb96f8f192e55d426e7b","observation_id":"a73b8b72-6820-4c81-8cc2-f0a71929ae09","resolution":{"observed_at":"2026-08-16T00:59:51.254940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.933609Z","title":"Unbiased multiple instance learning for weakly supervised video anomaly detection","venue":null,"work_id":"95a5de5e-3f54-457d-87ea-767e674f9997","year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.259995Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:eea1fc24786ac192c2df8fbeb569698c156a63bd6929b8e5a0450001951556d2","observation_id":"e5efb2e8-276e-41b2-b446-66fa84442a94","resolution":{"observed_at":"2026-08-16T00:59:52.940320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08315","last_updated":"2023-10-12T13:26:04Z","snapshot_observed_at":"2026-08-16T14:52:42.193269Z","submitted_at":"2023-10-12T13:26:04Z","title":"Fusion framework and multimodality for the Laplacian approximation of Bayesian neural networks","version":1},"cited_work":{"arxiv_id":"2310.08315","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.08315","snapshot_observed_at":"2026-08-16T00:59:51.731908Z","title":"Fusion framework and multimodality for the Laplacian approximation of Bayesian neural networks","venue":"eess.SP","work_id":"e3938d1b-1987-4520-ad69-aab26dd90a3a","year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.265869Z"},"links":{"cited_paper":"/paper/2310.08315","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:8d42b33881eaaccb9650b4da4f6288c06106446ad6e3853ef9892e61f1f7b0a4","observation_id":"a2b0026c-0b4b-4580-a646-be1a479a374b","resolution":{"observed_at":"2026-08-16T00:59:51.738132Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.914521Z","title":"Multimodal deep learning","venue":null,"work_id":"bb916efb-bbf5-420b-9839-684cf0f1dca7","year":2011},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.270980Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:eb588897204a6d4997446c8692bc2adc4a1382b69cd282438df0bacfd6609dba","observation_id":"e83c381b-31cf-4af1-a626-27495915754f","resolution":{"observed_at":"2026-08-16T00:59:52.920087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.896423Z","title":"The promises and pitfalls of bayesian deep learning in computer vision","venue":null,"work_id":"20cccc37-71b6-4618-a2cb-dbf0dc34cd98","year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.275910Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:fd61d75b5e51754e3fef01df41a0a89625188da906d6bc332c801565d3c85447","observation_id":"82c82bff-e4cf-4a71-be1d-48a7ba44c637","resolution":{"observed_at":"2026-08-16T00:59:52.901587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.876602Z","title":"Converting static image datasets to spiking neuromorphic datasets using saccades","venue":null,"work_id":"e4b28b8c-f335-45ed-942a-330839eab327","year":2015},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.281415Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:c5ba304952888288cdfedb7b96b70d372e90e19c9d6ba1c2637c816cca321624","observation_id":"4851836c-707e-4a34-afdc-d29f18cdbc61","resolution":{"observed_at":"2026-08-16T00:59:52.883080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.817317Z","title":"Can you trust your model’s uncertainty? evaluating predictive uncer- tainty under dataset shift","venue":null,"work_id":"e1ecf7c9-95fa-471b-8944-62bf6f108ac5","year":2019},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.287230Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:672373932c95259701f988775f2d5d3f58f7c2f185bc148878891b9a5a3d64c4","observation_id":"57921c89-bb07-4baf-98f9-94827a6e8a9c","resolution":{"observed_at":"2026-08-16T00:59:52.862557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.754586Z","title":"Back to event basics: Self-supervised learning of image reconstruction for event cameras via photometric constancy","venue":null,"work_id":"e7b98cae-4e8f-4bbf-8681-6ac5fe35741f","year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.292299Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:b4ba2453d2f9adb775c33190a61e071015bc4916262a1580f31899e0df05e620","observation_id":"86e14edf-9d3d-4ff4-bef0-4212e5e146b7","resolution":{"observed_at":"2026-08-16T00:59:52.760900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12763","last_updated":"2024-12-19T19:37:44Z","snapshot_observed_at":"2026-08-16T13:24:27.681059Z","submitted_at":"2024-08-22T23:32:42Z","title":"Assessing Modality Bias in Video Question Answering Benchmarks with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12763","snapshot_observed_at":"2026-08-16T00:59:51.297175Z","title":"Assessing modality bias in video question answering benchmarks with multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.297175Z"},"links":{"cited_paper":"/paper/2408.12763","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:f8ad8565d6052a2c1c808d9303e4c77d26572844eef97831ac1b4c70bffdffb4","observation_id":"5a55de31-607b-45a5-81ef-9bb470d29ee4","resolution":{"observed_at":"2026-08-16T00:59:51.297175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:51.302358Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.302358Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:f0d3f773767fda9570701fefa9f6c8f77840a2f9fc116c6d5981ac4a22b10ee5","observation_id":"aa77bc7b-fdee-4826-bd8a-d2f197c632e2","resolution":{"observed_at":"2026-08-16T00:59:51.302358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.726224Z","title":"Events-to-video: Bringing modern computer vision to event cameras","venue":null,"work_id":"71eb15f8-d3de-459f-890f-ec0f267603a4","year":2019},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.308357Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:1470aca6e72de227524fb03427002c5671a00f12205e1fcfc3094db53045b642","observation_id":"dbfbc59c-f5ec-430d-a485-43d0ca7206c1","resolution":{"observed_at":"2026-08-16T00:59:52.731398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05425","last_updated":"2023-06-08T17:59:56Z","snapshot_observed_at":"2026-08-16T15:25:23.093007Z","submitted_at":"2023-06-08T17:59:56Z","title":"MIMIC-IT: Multi-Modal In-Context Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05425","snapshot_observed_at":"2026-08-16T00:59:51.313318Z","title":"Multimodal foundation models: From specialists to general-purpose learners","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.313318Z"},"links":{"cited_paper":"/paper/2306.05425","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:fb3e6af29b98cf61491ae4aed460705e052bf233b325a390827c66877a274e4e","observation_id":"0397e637-265b-4712-be5b-2ccd9f9c606b","resolution":{"observed_at":"2026-08-16T00:59:51.313318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.706425Z","title":"Secrets of event-based optical flow","venue":null,"work_id":"93f52f29-e976-4dcd-8a91-e1e7fd0127cb","year":2022},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.318431Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:4e017974069a4ad174820c29bf4c9802a44efd8083f4fd444273815734cb928e","observation_id":"b4808dfd-ba93-460d-ba5d-432f5998f5fa","resolution":{"observed_at":"2026-08-16T00:59:52.711966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.10811","last_updated":"2019-09-20T05:35:30Z","snapshot_observed_at":"2026-08-14T17:52:52.942237Z","submitted_at":"2018-11-27T04:51:54Z","title":"Uncertainty aware audiovisual activity recognition using deep Bayesian variational inference","version":3},"cited_work":{"arxiv_id":"1811.10811","doi":null,"metadata_source":"pith","pith_arxiv_id":"1811.10811","snapshot_observed_at":"2026-08-16T00:59:51.634480Z","title":"Uncertainty aware audiovisual activity recognition using deep Bayesian variational inference","venue":"cs.NE","work_id":"e69b53ac-ff71-4c6b-a0e3-7f09f09af9d1","year":2018},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.323104Z"},"links":{"cited_paper":"/paper/1811.10811","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:d3961b49a497510f42af0a269ddaf30e2a4e4bcd41f88e96de4d009b03782394","observation_id":"8f76194b-f8ca-4f74-bc18-791f27d14e66","resolution":{"observed_at":"2026-08-16T00:59:51.644298Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:51.328135Z","title":"Real-world anomaly detection in surveillance videos","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.328135Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:2d94f84e54decfbcea28768a956b4a79da7940a039b8d1ba01a367d905ea4da1","observation_id":"6f9fbbc9-e74f-41a2-91c7-1206d29b18fa","resolution":{"observed_at":"2026-08-16T00:59:51.328135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.673456Z","title":"Hawk: Learning to understand open-world video anomalies","venue":null,"work_id":"b38007ca-7ad8-4a48-b72b-fefc8ed6a004","year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.332826Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:003a63a6c262e1c95a11a9c40deca50ccdbe1d3992700fe873e66427adae615b","observation_id":"0fa57dc7-8305-4751-af3d-a4f02bb74bd0","resolution":{"observed_at":"2026-08-16T00:59:52.680219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.655902Z","title":"Weakly-supervised video anomaly detection with robust temporal feature magnitude learning","venue":null,"work_id":"d3efcc1f-f8c7-42f5-bce6-62098d7c1c08","year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.337695Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:f7400e525956229185ff80d50676ab86604560358b013ca5a83cf96282c6f39d","observation_id":"1d6824cd-2d11-4d8f-b89c-3c02bd725218","resolution":{"observed_at":"2026-08-16T00:59:52.661095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.636780Z","title":"Multimodal transformer for unaligned multimodal language sequences","venue":null,"work_id":"a23d81df-e632-49ba-87eb-8c77ea3fd034","year":2019},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.343239Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:10131e9b617099be5b6e99f229448d84a4faf90a9e71640a54eb5dd1cc12d2b7","observation_id":"865ea0b8-ff42-43d2-b847-a3c26e6ab6cd","resolution":{"observed_at":"2026-08-16T00:59:52.643111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.618667Z","title":"Exploiting spatial sparsity for event cameras with visual transformers","venue":null,"work_id":"157e3eeb-f6f7-4287-b44a-27f3510bb0a2","year":2022},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.348793Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:46b0877c322149787ba5969828f44e6d11fe42433461eebbd3fa8d6d9d0032e7","observation_id":"5c085303-b8cc-4675-bff7-8bdcae640744","resolution":{"observed_at":"2026-08-16T00:59:52.623909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.533935Z","title":"An introduction to the kalman filter.University of North Carolina at Chapel Hill, Department of Computer Science, 7(1):1–16, 1995","venue":null,"work_id":"39b52fdf-b13e-4066-b822-d30c67b395af","year":1995},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.353812Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:63d6696ba0c3ba7aeb95989a77a5d5a4129b0e5095fbe005649b96b3e5481622","observation_id":"464f3c52-b14b-4bb7-b556-f1ad0425cf9d","resolution":{"observed_at":"2026-08-16T00:59:52.591576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.491434Z","title":"Student-t processes for bayesian deep learning","venue":null,"work_id":"67bc8e7a-8a41-49b3-838a-f35512f4ffec","year":2021},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.358564Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:9e00fbaf9cc5b85aeaeef0fe857049861cdf1b031ccef9c888f58fd61d14f712","observation_id":"b8965e62-46ce-4dbd-831d-185285e5d120","resolution":{"observed_at":"2026-08-16T00:59:52.501231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.471260Z","title":"Not only look, but also listen: Learning multimodal violence detection under weak supervision","venue":null,"work_id":"0267f52a-1eda-4182-bb25-2a37fe047672","year":2020},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.363313Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:36bba66626d3ac520777e8c4638eb7e729a6bc38e604453ac7d32b03dff1dca7","observation_id":"3db6dd4a-decd-4d74-9a9e-8b30c266bf87","resolution":{"observed_at":"2026-08-16T00:59:52.477160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.451352Z","title":"Weakly supervised audio-visual violence detection","venue":null,"work_id":"a4a033b8-509d-4ab4-8550-7f9dfe1f25e6","year":2022},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.368690Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:f0993bc9ee981ef83aaa7615d779eff8b56757139e34b59c94145876ebca8356","observation_id":"6d1ac934-6668-4d55-9520-3d7b59889d20","resolution":{"observed_at":"2026-08-16T00:59:52.457331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:51.373329Z","title":"Open-vocabulary video anomaly detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.373329Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:6b57cd68712df51d744b6d5edabf71d1a3f80cac869abf6614ce391bff43687f","observation_id":"0365dcd2-e4df-4828-aa2f-44a7efdd657e","resolution":{"observed_at":"2026-08-16T00:59:51.373329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.417084Z","title":"Weakly supervised video anomaly detection and localization with spatio- temporal prompts","venue":null,"work_id":"846e059f-6fad-4a40-b079-65acaf141734","year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.377899Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:5c1210606343ff0dcfea336507047d639b4894e44702837aa356313cc4e65537","observation_id":"f125d059-3a65-4936-96a8-84d47391a91f","resolution":{"observed_at":"2026-08-16T00:59:52.422530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.400260Z","title":"Vadclip: Adapting vision-language models for weakly supervised video anomaly detection","venue":null,"work_id":"f20711ab-ba26-4ab9-8d19-ab4d1510f89f","year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.382745Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:ab4c6f5c9001b64378bc97e87413bd928db0c102c209ae2368465fdd2722854e","observation_id":"bf9329c8-4164-484f-8acd-52dbe908bb4a","resolution":{"observed_at":"2026-08-16T00:59:52.405531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06354","last_updated":"2023-11-16T19:26:02Z","snapshot_observed_at":"2026-08-16T15:24:58.432056Z","submitted_at":"2023-06-10T06:05:35Z","title":"EventCLIP: Adapting CLIP for Event-based Object Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.06354","snapshot_observed_at":"2026-08-16T00:59:51.387962Z","title":"Eventclip: Adapting clip for event-based object recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.387962Z"},"links":{"cited_paper":"/paper/2306.06354","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:9232709e80d7f53e81984f018435617b0191a765b3d042872a97fddf6f1717de","observation_id":"abdcde94-6a30-4c5b-8d4f-8af9427c8794","resolution":{"observed_at":"2026-08-16T00:59:51.387962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:51.393637Z","title":"Multimodal learning with transformers: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.393637Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:e12337dc109f4144ca19baa987e842a4cfac5e2f7216539abf3cf47d475a22a9","observation_id":"69c9384f-ba9d-498c-88bc-09a8745a6e3c","resolution":{"observed_at":"2026-08-16T00:59:51.393637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.372684Z","title":"Event camera data pre-training","venue":null,"work_id":"f5cbe8e8-e418-4b13-acc6-8db1130ac4a9","year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.398223Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:114f14d9ffd8ab82d54e0b850ae8840d08d1e151562276f8234b4a90555315b1","observation_id":"ee85bb26-e6bb-4c3b-96d0-e30f2662fadd","resolution":{"observed_at":"2026-08-16T00:59:52.378273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01095","last_updated":"2025-03-31T20:17:27Z","snapshot_observed_at":"2026-08-14T23:50:48.263579Z","submitted_at":"2024-12-02T04:10:14Z","title":"VERA: Explainable Video Anomaly Detection via Verbalized Learning of Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01095","snapshot_observed_at":"2026-08-16T00:59:51.403401Z","title":"Explainable video anomaly detection via verbalized learning of vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.403401Z"},"links":{"cited_paper":"/paper/2412.01095","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:3262ba9eab9fd0696f400c294e33ffcd8854be5cfbf354a575eb5d62d8ff32fc","observation_id":"b5ea1cc1-60d4-4d59-8442-241dcf9230c0","resolution":{"observed_at":"2026-08-16T00:59:51.403401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.286088Z","title":"Harness- ing large language models for training-free video anomaly detection","venue":null,"work_id":"284b1f47-bf64-4d0e-8f78-6a538f2e8dec","year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.409044Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:b0fbea9a1dd84e58e2c9f71082aa8375cd1bb89f94521438ee264e6df42a73fd","observation_id":"4ae0cbf2-168f-45a3-8317-2c6382ab08d8","resolution":{"observed_at":"2026-08-16T00:59:52.320617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06171","last_updated":"2025-03-14T10:23:06Z","snapshot_observed_at":"2026-08-17T13:28:50.254490Z","submitted_at":"2024-12-09T03:05:34Z","title":"Holmes-VAU: Towards Long-term Video Anomaly Understanding at Any Granularity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06171","snapshot_observed_at":"2026-08-16T00:59:51.413560Z","title":"Holmes-vau: Towards long-term video anomaly understanding at any granularity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.413560Z"},"links":{"cited_paper":"/paper/2412.06171","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:0cdaea6e72a4580f5d91048c35c75067b558e47afdd9fd3891322705f071c676","observation_id":"6f3cf1e8-48b9-45cf-8d5c-55ae3be4a4fe","resolution":{"observed_at":"2026-08-16T00:59:51.413560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.194393Z","title":"Event-based vision: A survey","venue":null,"work_id":"1ee8e519-5e0a-46b7-9f7b-ff2561c0e6c9","year":2022},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.419369Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:d4be10120eb1024b9d7ffea03a1c85e4b9b4de7e24c4d33074e415d1827f7a8b","observation_id":"07148c3b-e4cb-4f88-9926-925f3aa97674","resolution":{"observed_at":"2026-08-16T00:59:52.229629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-08-16T13:20:46.785210Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11381","snapshot_observed_at":"2026-08-16T00:59:51.424778Z","title":"Mm-react: Prompting chatgpt for multimodal reasoning and action","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.424778Z"},"links":{"cited_paper":"/paper/2303.11381","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:d4dc9e598335a99c40bc9f4e0d0bc1af31da3c43b87ed7c90876d85ba68f9e4d","observation_id":"c211819f-7d21-4fb2-af73-e20becea389f","resolution":{"observed_at":"2026-08-16T00:59:51.424778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08890","last_updated":"2024-04-11T15:34:46Z","snapshot_observed_at":"2026-08-17T09:05:47.162911Z","submitted_at":"2023-02-17T14:19:28Z","title":"Deep Learning for Event-based Vision: A Comprehensive Survey and Benchmarks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08890","snapshot_observed_at":"2026-08-16T00:59:51.429796Z","title":"Deep learning for event-based vision: A comprehensive survey and benchmarks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.429796Z"},"links":{"cited_paper":"/paper/2302.08890","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:eb5c8f9157b171d5bb919d9264123482013712fadfea8f970ff203be3bdd5970","observation_id":"d3ce162d-53f1-407a-9840-da164c299d3e","resolution":{"observed_at":"2026-08-16T00:59:51.429796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.160644Z","title":"Gtad: A semi-supervised learning framework for temporal anomaly detection in surveillance videos","venue":null,"work_id":"7dc3ebb6-9c40-4520-8519-ab3d09c3052e","year":2022},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.436124Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:703eeb72c594579c3cd248e21686039139c2b4f94505fb25d64b33f30a806b04","observation_id":"f16e67c7-fd2f-47f7-9037-3de0d052a2ca","resolution":{"observed_at":"2026-08-16T00:59:52.166704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:51.441628Z","title":"Dual memory units with uncertainty regulation for weakly supervised video anomaly detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.441628Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:68f5e808e6df99f5ecd0b9c2c52677ad15827fb5f20f18d509c65a3c2cd5e841","observation_id":"e5d6a689-e8fb-426e-bf40-7b9339dd8230","resolution":{"observed_at":"2026-08-16T00:59:51.441628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.129673Z","title":"Eventbind: Learning a unified repre- sentation to bind them all for event-based open-world understanding","venue":null,"work_id":"fcdb162f-7327-4f80-badc-975b18c09687","year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.447874Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:1f651ee88b339f6e4b0b931aae19a96ef69ce187d858f80a3b72a3da596db74b","observation_id":"c5893a05-a252-46f5-9bcb-b0a8975325ad","resolution":{"observed_at":"2026-08-16T00:59:52.135161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.113397Z","title":"Anomalynet: An anomaly detection network for video surveillance","venue":null,"work_id":"3abd1f2f-8df3-47e5-ae2f-200dcad0a79c","year":2019},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.454311Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:2b8a3b3392bf93116e0b72d7c1649feea98a23b22c9d3359bbed8f1fe409ade2","observation_id":"340ac21e-855f-4a85-8424-fda04c9b0841","resolution":{"observed_at":"2026-08-16T00:59:52.118320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.096719Z","title":"The multivehicle stereo event camera dataset: An event camera dataset for 3d perception","venue":null,"work_id":"24b2f710-d46d-4d3b-8628-c700c76cd191","year":2018},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.459519Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:6423c5b266df25ae4c792f8bb66ca2d291f1cfc7c530d408a9703bf3fcd5c32b","observation_id":"cb151c7d-28bb-4058-aac1-5243b9684712","resolution":{"observed_at":"2026-08-16T00:59:52.101914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:51.466232Z","title":"A variational bayesian approach to robust sensor fusion based on student-t distribution","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.466232Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:2090ff88d7525b8d46b733ce138e3ac06b1e3f9aeb8b94dc97eff0ca7b883ab7","observation_id":"fab8f0ee-5042-48ad-9208-63e77337a909","resolution":{"observed_at":"2026-08-16T00:59:51.466232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:59:52.067315Z","title":"Advancing video anomaly detection: A concise review and a new dataset","venue":null,"work_id":"6063e788-51b1-4229-8ee7-084eb929a17e","year":2024},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.472066Z"},"links":{"citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:7c788407f9b29866c0cdf2f84888bd04e75c35f298f72e69c85d3ef0fa549c1a","observation_id":"99f693be-e06a-4769-9909-dafc35e6dc49","resolution":{"observed_at":"2026-08-16T00:59:52.073087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01008","last_updated":"2024-08-16T16:26:11Z","snapshot_observed_at":"2026-08-17T15:34:37.775465Z","submitted_at":"2023-03-31T16:11:56Z","title":"Self-Supervised Multimodal Learning: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01008","snapshot_observed_at":"2026-08-16T00:59:51.477101Z","title":"synthetic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-16T00:59:51.477101Z"},"links":{"cited_paper":"/paper/2304.01008","citing_paper":"/paper/2505.02393"},"observation_digest":"sha256:da3731179f4161ce2a60d89099398f3ec949b09189707e08361c3c089aebf517","observation_id":"4b8ee675-dfc8-49e7-82c8-701e21427332","resolution":{"observed_at":"2026-08-16T00:59:51.477101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.02393","last_updated":"2025-05-08T09:44:41Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T13:29:26.120863Z","submitted_at":"2025-05-05T06:33:20Z","title":"Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":5,"verified_fuzzy":42},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 1 inbound Pith citation observation for arXiv:2505.02393."}