{"as_of":"2026-08-08T10:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7cb3e0b3b6d9d57d93a0c0741023129c0f8a89da81ca15a36987b9b3bffc6a07","coverage":[{"denominator":89,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":89,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:51:59.930418Z","state":"measured"},{"denominator":89,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":89,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.23283/citation-record","integrity":"/paper/2506.23283/integrity","json":"/paper/2506.23283/citation-record.json","paper":"/paper/2506.23283"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:51:50.381794Z","title":"Vivit: A video vision transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:50.381794Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:b26e42bd0f1dc9c0aa10900142dd50980acd885a5a17beb2ef0e062e87185e1d","observation_id":"d0566584-8b1a-4e89-bc30-b1d8a7a49a6e","resolution":{"observed_at":"2026-08-06T21:51:50.381794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-07-06T11:19:34.705520Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-06T21:51:50.473450Z","title":"BEiT: BERT Pre-Training of Image Transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:50.473450Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:877684fd48bcf0382948898dfc89e9a6f62275c0d422faa3d86e92a7919c5fea","observation_id":"18a8fd3e-b682-462a-913c-6f3ea3a4878d","resolution":{"observed_at":"2026-08-06T21:51:50.473450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:51:50.566560Z","title":"Is space-time attention all you need for video under- standing? In Proceedings of the International Confer- ence on Machine Learning (ICML), July 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:50.566560Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:78763d06b93d87956228ae11b08087342d1215a422e265bcc9c11490ac92a109","observation_id":"97822a62-148e-4a60-ad27-4c0290eedf20","resolution":{"observed_at":"2026-08-06T21:51:50.566560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:51:50.684318Z","title":"Coyo-700m: Image-text pair dataset, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:50.684318Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:c69f013154db7f6d21036128b91dc5ed68af0a28331cbad7135926281bb29978","observation_id":"0dd5bef8-715c-41db-a180-87c6bea1eb99","resolution":{"observed_at":"2026-08-06T21:51:50.684318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:51:50.823473Z","title":"Quo vadis, ac- tion recognition? a new model and the kinetics dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:50.823473Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:bc6192ff61fd3d56cdb383c96f2f7b8a41e5c9a64fbb1fa304d8215b14c796e5","observation_id":"066d303e-31f0-495a-a9d5-e53f30ab3fcf","resolution":{"observed_at":"2026-08-06T21:51:50.823473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09626","last_updated":"2024-03-14T17:57:07Z","snapshot_observed_at":"2026-07-06T17:44:45.924645Z","submitted_at":"2024-03-14T17:57:07Z","title":"Video Mamba Suite: State Space Model as a Versatile Alternative for Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09626","snapshot_observed_at":"2026-08-06T21:51:50.963310Z","title":"Video mamba suite: State space model as a versatile alternative for video understand- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:50.963310Z"},"links":{"cited_paper":"/paper/2403.09626","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:1077a23ba8ac03b5dc0db158cc3ee20168a0ffa1eb6d07425f07f84023aef40d","observation_id":"6b1b048b-180e-4829-9f5b-7141258a6a96","resolution":{"observed_at":"2026-08-06T21:51:50.963310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:51:51.088191Z","title":"A simple framework for con- trastive learning of visual representations, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:51.088191Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:9d6321c954ced0aba8a7c52bf5c7757332bef0cbfdd2e84cb6c7aee87d017c47","observation_id":"745bc955-cd20-424a-bb12-2e2c8673636e","resolution":{"observed_at":"2026-08-06T21:51:51.088191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:51:51.215965Z","title":"Feature-wise transformations","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:51.215965Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:09d92daf74b30d9f3bf01dce3c01d072e9b2dbed9573502fd5fa58b86ac7a0a4","observation_id":"35f85598-e66d-4960-b93e-a9b3d5b956d3","resolution":{"observed_at":"2026-08-06T21:51:51.215965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:51:51.324371Z","title":"Multiscale vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:51.324371Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:dde13b9164745448762bc3a8f62fb8551d5ec7cfbb11fb45c1b67754436a8c73","observation_id":"ae2ebe95-7d61-4550-8588-d8c48b4c95d4","resolution":{"observed_at":"2026-08-06T21:51:51.324371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:51:51.451686Z","title":"X3d: Expanding architec- tures for efficient video recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:51.451686Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:7c71643e82250e80f2f5d2ac7bde9a0bb584381a850f5e917b1a5da21ecde48f","observation_id":"56401364-3da8-488c-ad07-e74ededb08f6","resolution":{"observed_at":"2026-08-06T21:51:51.451686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09113","last_updated":"2022-10-21T09:16:43Z","snapshot_observed_at":"2026-07-06T13:11:18.837528Z","submitted_at":"2022-05-18T17:59:59Z","title":"Masked Autoencoders As Spatiotemporal Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09113","snapshot_observed_at":"2026-08-06T21:51:51.583049Z","title":"Masked autoencoders as spatiotemporal learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:51.583049Z"},"links":{"cited_paper":"/paper/2205.09113","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:2dc96e1a04f32b0246b35f342418dadd7f89367f2b217b9c8b3139fd7d892a97","observation_id":"2cfc5cce-ae53-43a3-9dfa-93799361f043","resolution":{"observed_at":"2026-08-06T21:51:51.583049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:51:51.697762Z","title":"Slowfast networks for video recog- nition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:51.697762Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:823a7b8f1acd7ac4c22261e2651edddfe5a89cff44a9f96830aad823c4bb8cd2","observation_id":"c259ede9-b86a-4879-9f91-ae3ec10321ff","resolution":{"observed_at":"2026-08-06T21:51:51.697762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:12.300587Z","title":"The” something something” video database for learning and evaluating visual common sense","venue":null,"work_id":"96b53f51-0b20-45c7-a9bc-9761531b6629","year":2017},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:51.830505Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:ffdf8de8602da0fc174358d7295a685ead8b18d47685915a0c2caa9e5d9911e3","observation_id":"5da590e6-82da-4603-8c2e-6b59e9ac8884","resolution":{"observed_at":"2026-08-06T21:52:12.327642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-06T21:51:51.926035Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:51.926035Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:78ffaa4a872b63d8d9b8121661bb036279ce1dc0ced2348f42e817c00a8ebab2","observation_id":"68690598-06ab-4175-870e-f52779ee66e8","resolution":{"observed_at":"2026-08-06T21:51:51.926035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-08-06T21:51:52.045734Z","title":"Effi- ciently modeling long sequences with structured state spaces","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:52.045734Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:547a67b7ee2701a7fc4412414db6cac515c7549878835f7c80f6479914679ce2","observation_id":"39b35f9b-124f-4e9d-90f8-3ea5f91027d2","resolution":{"observed_at":"2026-08-06T21:51:52.045734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:12.248509Z","title":"Open-vocabulary object detection via vision and language knowledge distillation","venue":null,"work_id":"f4087f70-e0fb-4218-8929-9d1fe690771f","year":2021},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:52.127801Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:2c84f652160f500770b923e8a5f4186770ed4e560b120a17334e914fa4718a74","observation_id":"70f67fe2-2691-497b-a62c-b808bbe5a4b0","resolution":{"observed_at":"2026-08-06T21:52:12.279929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:12.144922Z","title":"Trustworthy machine learning: From data to models","venue":null,"work_id":"eaf469a2-9085-4c3b-b8ff-f14aef00cad5","year":2025},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:52.256779Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:188381ea11e678fe9ae970ac7e98e71a358bb399ee42710cb637bf732e575181","observation_id":"d3fe1164-933b-4afb-abab-edf756748487","resolution":{"observed_at":"2026-08-06T21:52:12.195299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:12.029679Z","title":"Turbo training with token dropout","venue":null,"work_id":"b2f1ca68-dc44-4921-b365-22d06a533e33","year":2022},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:52.390034Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:99aaf2562df227b98c51a02a67849c8f685d6f26ef216b5b77f09c826593c73a","observation_id":"245cfa19-8e54-4bed-a6b5-431633cdeba3","resolution":{"observed_at":"2026-08-06T21:52:12.084240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:11.920134Z","title":"Learning spatio-temporal features with 3d residual networks for action recognition","venue":null,"work_id":"1eb3c06e-6ac0-4a52-96c6-a2355a25c8bf","year":2017},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:52.549772Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:142b74a0c6eb7926dce84ce433dcd21909bde7889689167a1712760482865cbe","observation_id":"75dbef3c-98ee-4f7e-9e9e-9b8c55438318","resolution":{"observed_at":"2026-08-06T21:52:11.978319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08083","last_updated":"2025-03-25T17:54:37Z","snapshot_observed_at":"2026-08-06T23:38:21.068023Z","submitted_at":"2024-07-10T23:02:45Z","title":"MambaVision: A Hybrid Mamba-Transformer Vision Backbone","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08083","snapshot_observed_at":"2026-08-06T21:51:52.633842Z","title":"Mambavision: A hybrid mamba-transformer vision backbone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:52.633842Z"},"links":{"cited_paper":"/paper/2407.08083","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:0a1e4c9b134a1ef662d18f3d59101e14da7b2fedfa67d1a7c5329871b9409042","observation_id":"fd048668-ac8d-4cbe-87be-bcb5b743aee7","resolution":{"observed_at":"2026-08-06T21:51:52.633842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:11.810145Z","title":"Clipscore: A reference- free evaluation metric for image captioning","venue":null,"work_id":"2b8bb159-b38f-4be6-aa6e-3197fd3a7b07","year":2021},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:52.745648Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:4a4690e5ff8b69aa8cfef9cfa1495965670d400110a24ba8084e2322cc32e9c7","observation_id":"a4995629-e6d5-4ab9-a680-a5d3da6ba861","resolution":{"observed_at":"2026-08-06T21:52:11.875378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:11.693872Z","title":"Arbitrary style trans- fer in real-time with adaptive instance normalization","venue":null,"work_id":"185e0043-511d-464a-9842-11bc8e36ee0b","year":2017},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:52.831996Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:05f170efeefdbdd26a52e4c52ff9f1ab624865d7c440d15426fda38c20caa50e","observation_id":"afba095f-b5d7-4a4d-a56f-5b12f2cf32f8","resolution":{"observed_at":"2026-08-06T21:52:11.750886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.05143","last_updated":"2019-10-13T09:44:11Z","snapshot_observed_at":"2026-08-08T10:14:34.912925Z","submitted_at":"2019-05-13T16:57:40Z","title":"VideoGraph: Recognizing Minutes-Long Human Activities in Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.05143","snapshot_observed_at":"2026-08-06T21:51:52.943841Z","title":null,"venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:52.943841Z"},"links":{"cited_paper":"/paper/1905.05143","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:254ce8fe4bac6bc4a2b01d8dec1cdcc104d7633fa9ba8d11aa1ac37f9dc78c1d","observation_id":"250059a2-427d-4720-9901-4c9cb5b8384e","resolution":{"observed_at":"2026-08-06T21:51:52.943841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:11.575837Z","title":"Smeulders","venue":null,"work_id":"277a86b2-741d-40ad-8466-efab3d672a58","year":2019},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:53.022920Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:3a86b96ff3a033bd3f62c8c83528859f61ba6ecda1a522e55bf737028c5ff52f","observation_id":"75807e7a-5368-46d2-982f-815c6503e810","resolution":{"observed_at":"2026-08-06T21:52:11.626186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:11.447965Z","title":"Long movie clip classification with state-space video mod- els","venue":null,"work_id":"1b33bcf6-03ef-47bc-bcd2-3790df4920c6","year":2022},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:53.133192Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:c31a72f8ff91db6880f62e67bc88735ae010fd140bd03b11ac3ec3c1ea855ab5","observation_id":"5c017a9e-706f-40cf-af86-3ef5a43b02f3","resolution":{"observed_at":"2026-08-06T21:52:11.504852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:11.360630Z","title":"Scaling up visual and vision- language representation learning with noisy text su- pervision","venue":null,"work_id":"0351ef4b-886d-4e5d-97af-7d71d727b0cb","year":2021},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:53.286576Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:075c2e1a042a1bbf521e117d33804f1cb0de20b7e8162da50fffa3cff0856623","observation_id":"034efcb6-bfc0-4177-9cbf-e9149da6fe12","resolution":{"observed_at":"2026-08-06T21:52:11.396778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:11.230254Z","title":"Laine, and Timo Aila","venue":null,"work_id":"530e2764-9495-4ad8-856f-d43e5e278894","year":2018},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:53.420848Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:950d8132353d1c6897a8d3fe545f38d53a713eb6780e573d6bdf1b69090aa9fa","observation_id":"06acb9ba-58e8-401a-b5ea-eddbfbff387e","resolution":{"observed_at":"2026-08-06T21:52:11.285784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T10:06:58.769155Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-06T21:51:53.493512Z","title":"The kinetics human action video dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:53.493512Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:65f893ec6417f50eccfbacb3f437d3e81bc6701347d748cc14a49c291797e897","observation_id":"c231f89a-87ef-43fe-b2bd-7cd483c811f4","resolution":{"observed_at":"2026-08-06T21:51:53.493512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:11.103634Z","title":"Kuehne, H","venue":null,"work_id":"b46a7bc9-4d76-442d-a770-784bb3aaf35f","year":2011},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:53.561748Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:0009288721a9af5e525b7053fce715485639757f6689faf50ccdcfac190232c9","observation_id":"4e4c4956-8e4e-498e-9b53-449f2cedceab","resolution":{"observed_at":"2026-08-06T21:52:11.170200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:10.951191Z","title":"The lan- guage of actions: Recovering the syntax and semantics of goal-directed human activities","venue":null,"work_id":"837efa7a-b45e-4dd9-98d9-b61e77bbe906","year":2014},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:53.693704Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:f7c21e3a15a6a468e3377672926e2309bd679e3837feaa812b1e3d4bbd985708","observation_id":"8821f97d-59ee-4773-9bee-8fc6a466d9c6","resolution":{"observed_at":"2026-08-06T21:52:11.036537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15639","last_updated":"2023-02-23T19:14:52Z","snapshot_observed_at":"2026-07-06T13:58:22.032846Z","submitted_at":"2022-09-30T17:59:52Z","title":"F-VLM: Open-Vocabulary Object Detection upon Frozen Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15639","snapshot_observed_at":"2026-08-06T21:51:53.789728Z","title":"F-vlm: Open-vocabulary object detection upon frozen vision and language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:53.789728Z"},"links":{"cited_paper":"/paper/2209.15639","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:a4f4ad40eeefd60afdfa6312279339cd06c6df4ba13ecde5e6252047f29e177b","observation_id":"11c6d7db-7c34-4bcf-985a-a185bbf26bb1","resolution":{"observed_at":"2026-08-06T21:51:53.789728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06286","last_updated":"2024-08-12T16:49:22Z","snapshot_observed_at":"2026-07-06T18:59:43.564435Z","submitted_at":"2024-08-12T16:49:22Z","title":"Mipmap-GS: Let Gaussians Deform with Scale-specific Mipmap for Anti-aliasing Rendering","version":1},"cited_work":{"arxiv_id":"2408.06286","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.06286","snapshot_observed_at":"2026-08-06T21:52:01.081500Z","title":"Mipmap-GS: Let Gaussians Deform with Scale-specific Mipmap for Anti-aliasing Rendering","venue":"cs.CV","work_id":"7be09dc3-ac55-4b91-bd62-929eb6a70be8","year":2024},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:53.897777Z"},"links":{"cited_paper":"/paper/2408.06286","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:42f9b98562009ce1114ae830082a3788793765f8a683733c6f0d554ff5d7d183","observation_id":"965818a5-d127-4beb-b212-05a651f0ad89","resolution":{"observed_at":"2026-08-06T21:52:01.162745Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:10.742550Z","title":"Videomamba: State space model for efficient video understanding, 2024","venue":null,"work_id":"464bab6c-07da-412c-8334-08acb05bf7ce","year":2024},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:54.013868Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:6103e9ec406febbae48b6d739659b3876b65d9400db86ea238f51b5803c2cb43","observation_id":"6c983faf-b075-426a-beb7-3bd8197b733e","resolution":{"observed_at":"2026-08-06T21:52:10.830280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:10.563323Z","title":"Unmasked teacher: Towards training-efficient video foundation models","venue":null,"work_id":"2b5b2bd7-63e6-4dbb-b2e6-4631ec2d9f3c","year":2023},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:54.127628Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:423c24e909dff885e5f567dfed818e7b5fd32f0c2b804203ff93cd83ad7485aa","observation_id":"02fcb1cf-32a1-4da0-b55e-7c84cb0018dc","resolution":{"observed_at":"2026-08-06T21:52:10.653523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:10.385902Z","title":"Uniformer: Uni- fied transformer for efficient spatial-temporal repre- sentation learning","venue":null,"work_id":"37dda3e0-8d51-415c-8deb-f8d3c9526fc4","year":2021},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:54.238037Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:827f5f88eddef5140acba134ee9432005440a24b37cb51064eb00b76571aa552","observation_id":"27f5fb1b-f812-4cce-97ce-0a366490a1c7","resolution":{"observed_at":"2026-08-06T21:52:10.465539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:10.243927Z","title":"Mvitv2: Improved multiscale vision transformers for classification and detection","venue":null,"work_id":"0f27d280-11d0-4633-80ee-c3c7049feca2","year":2022},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:54.367511Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:5c1983deb3be80f65f0b2a060ad62bfef7bef116cbb32c379a7f4e6ac5b28708","observation_id":"26abb7e7-33e8-4293-b6cf-5b079c84c844","resolution":{"observed_at":"2026-08-06T21:52:10.330276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:10.051575Z","title":"Fo- caldreamer: Text-driven 3d editing via focal-fusion assembly","venue":null,"work_id":"f16ae66d-4861-4ff0-a894-132ee0f4b859","year":2024},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:54.431653Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:0fe182e6d53f6c1322fe5701aa7636f3a241ce2710a723528b1e1e6e299ce191","observation_id":"1141e522-dbbe-4950-b689-f4c2bf95f6ed","resolution":{"observed_at":"2026-08-06T21:52:10.141385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:09.898963Z","title":"Pointmamba: A simple state space model for point cloud analysis","venue":null,"work_id":"553c4597-4bc8-4dcf-927e-278867d24b9f","year":2024},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:54.524479Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:3974b588710a7d8837ed2dff0aa11f777c67815a7b97cfbb420235ea145dc249","observation_id":"83f7f27f-ffb3-4433-80db-6750c1eb9ce2","resolution":{"observed_at":"2026-08-06T21:52:09.960882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-08-06T21:51:54.612897Z","title":"Jamba: A hybrid transformer-mamba language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:54.612897Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:e807b3e158ae7b8670cab7e7f7eb8a9acd60cae4d1afc2b29d3bdfb9312b3ba9","observation_id":"096c446c-94c6-459f-8729-50371225bc84","resolution":{"observed_at":"2026-08-06T21:51:54.612897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:09.741637Z","title":"Learning to recognize procedural activities with dis- tant supervision","venue":null,"work_id":"e32e9021-8d6d-4a7f-ae7a-0fcf9c7d9dfd","year":2022},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:54.696571Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:2c4dc3d142e37c27097997e99b27cef73110a2778469887cc9a8d099afe70e33","observation_id":"e29d25ed-702c-46a4-ac21-893c111fc511","resolution":{"observed_at":"2026-08-06T21:52:09.822263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03550","last_updated":"2022-08-06T17:38:25Z","snapshot_observed_at":"2026-07-06T13:39:25.193919Z","submitted_at":"2022-08-06T17:38:25Z","title":"Frozen CLIP Models are Efficient Video Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03550","snapshot_observed_at":"2026-08-06T21:51:54.788646Z","title":"Frozen clip models are efficient video learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:54.788646Z"},"links":{"cited_paper":"/paper/2208.03550","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:d3d5dd9f9e731436b9bb2fd69912ccc4359e946c7ce691340070bd28bed73801","observation_id":"82ff3b0f-f212-4e6f-88d6-b2b3490609bf","resolution":{"observed_at":"2026-08-06T21:51:54.788646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11019","last_updated":"2023-10-07T07:57:15Z","snapshot_observed_at":"2026-08-02T11:10:26.756993Z","submitted_at":"2023-05-18T14:52:45Z","title":"Annotation-free Audio-Visual Segmentation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11019","snapshot_observed_at":"2026-08-06T21:51:54.889200Z","title":"Annotation-free audio-visual segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:54.889200Z"},"links":{"cited_paper":"/paper/2305.11019","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:2cdf59166815b1528e66051d8c430f0536d57cdb61b094adfd62409936e280ca","observation_id":"9898fcdc-ced0-4e8e-9241-e170e65e6353","resolution":{"observed_at":"2026-08-06T21:51:54.889200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10166","last_updated":"2024-12-29T14:57:13Z","snapshot_observed_at":"2026-07-06T17:17:31.008185Z","submitted_at":"2024-01-18T17:55:39Z","title":"VMamba: Visual State Space Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10166","snapshot_observed_at":"2026-08-06T21:51:54.973660Z","title":"Vmamba: Visual state space model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:54.973660Z"},"links":{"cited_paper":"/paper/2401.10166","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:40659b0643c26d64e6dd0b63907399d284fde30940711b3502167d8cb2971e8b","observation_id":"b070c1c1-bf0e-4edd-b688-d0623e3d3f36","resolution":{"observed_at":"2026-08-06T21:51:54.973660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:09.617080Z","title":"Video swin transformer","venue":null,"work_id":"b8b490c1-143b-4c6d-9dd5-e8a648d556be","year":2022},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:55.081355Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:9a014063909321685ba350732780c1182f5ea77af1d210576da878db0997cc26","observation_id":"3b47763b-25ec-4a8e-bbc0-c867acec771c","resolution":{"observed_at":"2026-08-06T21:52:09.670936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:09.451739Z","title":"Freesegdiff: Annotation-free saliency segmentation with diffusion models","venue":null,"work_id":"f490cb00-bad8-4687-96b4-70068d551b4e","year":2025},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:55.165046Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:495f7f0498e6f1cbf5a5cdb500d08ddda63605e302542426f52fd21deca7f5e7","observation_id":"6170fa3d-63f0-4201-b1f0-b538fecb1aa3","resolution":{"observed_at":"2026-08-06T21:52:09.524175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09813","last_updated":"2023-03-17T07:47:55Z","snapshot_observed_at":"2026-07-06T15:04:49.291968Z","submitted_at":"2023-03-17T07:47:55Z","title":"DiffusionSeg: Adapting Diffusion Towards Unsupervised Object Discovery","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09813","snapshot_observed_at":"2026-08-06T21:51:55.235358Z","title":"Dif- fusionseg: Adapting diffusion towards unsupervised object discovery","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:55.235358Z"},"links":{"cited_paper":"/paper/2303.09813","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:eff615919cfc60229d72ab2dcd3c76879d38557dab7650eed45168d053cee818","observation_id":"03621015-443a-4b08-92ce-7b5cb1f70656","resolution":{"observed_at":"2026-08-06T21:51:55.235358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:09.209819Z","title":"Open-vocabulary semantic segmenta- tion with frozen vision-language models","venue":null,"work_id":"ba807753-54d9-44ac-b48b-dff3ec68a324","year":2022},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:55.327089Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:28cd55649140f5ff801a9a0f665c0e077598d556fc687f32e863a554381de0d0","observation_id":"e52b8b84-b3f9-4342-bf72-92861215bdd6","resolution":{"observed_at":"2026-08-06T21:52:09.336866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:09.023420Z","title":"Attrseg: open- vocabulary semantic segmentation via attribute decomposition-aggregation","venue":null,"work_id":"6a2f3bb5-5882-4bea-8438-a540ab24344e","year":2023},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:55.420685Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:bbbc475cc52d81e45caeb25d798bd8bc74a26dd30513c79808d90c3beefac8f6","observation_id":"69c49ab9-c49e-4727-87ca-5df1356d7e02","resolution":{"observed_at":"2026-08-06T21:52:09.120762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:07.369363Z","title":"Scaling open-vocabulary object detection","venue":null,"work_id":"497b4d92-56da-4554-8418-f591c2c2f980","year":2023},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:55.482406Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:98675f4903169a5287c34ef7bfe9b0827f2383810e0ecd47b2ed4d9d44141bbc","observation_id":"2573ff8e-3f54-4079-b207-f54ad18e4c47","resolution":{"observed_at":"2026-08-06T21:52:07.890235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-06T21:51:55.557921Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:55.557921Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:1554996e44604561f190ae4db274bd9a14a2303fca4ae53955e3ff3cde2ef5d5","observation_id":"46177889-2581-457d-bd97-0e86f0a016ed","resolution":{"observed_at":"2026-08-06T21:51:55.557921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.02816","last_updated":"2022-08-04T17:59:54Z","snapshot_observed_at":"2026-07-06T13:38:51.659499Z","submitted_at":"2022-08-04T17:59:54Z","title":"Expanding Language-Image Pretrained Models for General Video Recognition","version":1},"cited_work":{"arxiv_id":"2208.02816","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.02816","snapshot_observed_at":"2026-08-06T21:52:00.789621Z","title":"Expanding Language-Image Pretrained Models for General Video Recognition","venue":"cs.CV","work_id":"232945dc-90b5-4de4-b4de-a98b78f0cb86","year":2022},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:55.663136Z"},"links":{"cited_paper":"/paper/2208.02816","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:c4c32f02c3b5109c9a9bd42908f1de970aa2c24169b2a390d9a842a72f1cd39b","observation_id":"8bad67b6-8264-424e-98ae-4d4ea9723705","resolution":{"observed_at":"2026-08-06T21:52:00.859981Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00575","last_updated":"2022-11-01T16:36:01Z","snapshot_observed_at":"2026-07-06T14:13:07.158001Z","submitted_at":"2022-11-01T16:36:01Z","title":"Text-Only Training for Image Captioning using Noise-Injected CLIP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00575","snapshot_observed_at":"2026-08-06T21:51:55.746646Z","title":"Text-only training for image captioning using noise- injected clip","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:55.746646Z"},"links":{"cited_paper":"/paper/2211.00575","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:3882a47e90b07e4891aaab63a9fdae23d5af697b28a465fb180d183c4e8de113","observation_id":"00a9a893-7320-4bb5-884a-67d9c6c1167c","resolution":{"observed_at":"2026-08-06T21:51:55.746646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:07.102273Z","title":null,"venue":null,"work_id":"a812be2d-9151-4d87-a3a5-c5a7b319569d","year":2023},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:55.855563Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:a01d8471d431e9ff9c1a5bc024e23143f83d3dc2bcc95685375d24e729c54a95","observation_id":"1fceb07c-de6f-4b34-9b3b-72af3549bc11","resolution":{"observed_at":"2026-08-06T21:52:07.162702Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.13559","last_updated":"2022-10-13T06:34:19Z","snapshot_observed_at":"2026-08-02T02:14:22.911676Z","submitted_at":"2022-06-27T18:02:29Z","title":"ST-Adapter: Parameter-Efficient Image-to-Video Transfer Learning","version":3},"cited_work":{"arxiv_id":"2206.13559","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.13559","snapshot_observed_at":"2026-08-06T21:52:00.553316Z","title":"ST-Adapter: Parameter-Efficient Image-to-Video Transfer Learning","venue":"cs.CV","work_id":"9d72fb57-3f92-48d4-9c64-a0f733be4c6b","year":2022},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:55.932723Z"},"links":{"cited_paper":"/paper/2206.13559","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:84d3479f16efecb19c2fd58d5d9000a89c4e1acdb58dea987d2975f58e0e8da0","observation_id":"600a5af7-0e65-45fa-9ef4-dc11436ed1f6","resolution":{"observed_at":"2026-08-06T21:52:00.638728Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14214","last_updated":"2024-10-18T07:02:57Z","snapshot_observed_at":"2026-07-06T19:35:48.603411Z","submitted_at":"2024-10-18T07:02:57Z","title":"MambaSCI: Efficient Mamba-UNet for Quad-Bayer Patterned Video Snapshot Compressive Imaging","version":1},"cited_work":{"arxiv_id":"2410.14214","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.14214","snapshot_observed_at":"2026-08-06T21:52:00.338309Z","title":"MambaSCI: Efficient Mamba-UNet for Quad-Bayer Patterned Video Snapshot Compressive Imaging","venue":"cs.CV","work_id":"27154fcd-4001-4dc4-b94a-300218973feb","year":2024},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:56.065967Z"},"links":{"cited_paper":"/paper/2410.14214","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:3fbade5da14bb29932922dedb16b296e5fcac72d35ff7a43dc1e14d2af479130","observation_id":"47ad84a8-cfe1-489d-8460-5ab7d35ae11f","resolution":{"observed_at":"2026-08-06T21:52:00.425970Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:06.853375Z","title":"Dual-path adaptation from image to video transform- ers","venue":null,"work_id":"4671538b-4500-4e0b-95c9-365299083950","year":2023},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:56.170231Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:ef9a2dd9eb1a4b4c08244d0ef732c3896267559dd629ce36e3e381abc2ee8683","observation_id":"01124fa0-a327-49ef-ac19-31cb7f5beac9","resolution":{"observed_at":"2026-08-06T21:52:06.981489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:06.640849Z","title":"Peebles and Saining Xie","venue":null,"work_id":"3fe911ed-ac39-40b6-a16b-cd3df03988fd","year":2022},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:56.291434Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:da8e3ab07bc08e39f2189909d9a337dcc151bb74ffef8d172ad11c50842c280b","observation_id":"56679b2e-1c87-4056-a665-fe6bc03ccdb6","resolution":{"observed_at":"2026-08-06T21:52:06.766762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:06.386720Z","title":null,"venue":null,"work_id":"1e6b56b6-a979-46f1-950f-c9441ea20607","year":2017},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:56.418109Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:d8281cc540fd01e404d01f0fed7ad8da307cdf911a47543064e3baf671b7cb2e","observation_id":"e3362da8-a59f-4667-bb1e-fe3b44df7dbd","resolution":{"observed_at":"2026-08-06T21:52:06.501535Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:06.188905Z","title":"Dis- entangling spatial and temporal learning for efficient image-to-video transfer learning","venue":null,"work_id":"7922c4ca-6e98-4379-87f1-066df2774560","year":2023},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:56.546195Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:b5046e11deba4d30167236cbfc26fdd23ca5293c31b5074e5d164e881b76dd30","observation_id":"09d3aab8-921b-417a-ba0d-7e92b0719a3c","resolution":{"observed_at":"2026-08-06T21:52:06.295700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:06.058564Z","title":"Learning transferable visual models from natural lan- guage supervision","venue":null,"work_id":"d2738c12-e2fe-4232-bc1f-cce5660a144a","year":2021},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:56.659418Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:0c25ce68af23f7d69b117b2fec2dbcb79b364749b1a465e754f2305454d0821e","observation_id":"4c805022-7f59-4adb-be59-353adf757540","resolution":{"observed_at":"2026-08-06T21:52:06.119792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:05.890607Z","title":"Token- learner: Adaptive space-time tokenization for videos","venue":null,"work_id":"563f7755-9912-470d-a7db-257e1e821e9d","year":2021},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:56.759866Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:94bc367bf5b0521f601c257b2590935bdb3d5b0a357cc7c061c807eae5848edd","observation_id":"ead28b01-3e89-46be-8e2f-ef446ded4382","resolution":{"observed_at":"2026-08-06T21:52:05.975865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08402","last_updated":"2022-10-16T00:08:18Z","snapshot_observed_at":"2026-07-29T21:51:47.064287Z","submitted_at":"2022-10-16T00:08:18Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.08402","snapshot_observed_at":"2026-08-06T21:51:56.863163Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:56.863163Z"},"links":{"cited_paper":"/paper/2210.08402","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:32c5933b9bdc38ef4a92e36cc77f32cd0529b993c746ad50f0af033b8dc17fb4","observation_id":"7c17898b-796b-46d0-afdd-8836a651f2b1","resolution":{"observed_at":"2026-08-06T21:51:56.863163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:05.688478Z","title":"Only time can tell: Discovering temporal data for temporal modeling","venue":null,"work_id":"5cbe6465-bcf7-4f98-8462-31dbe9540c96","year":2021},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:56.962660Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:54ae4d5c036ba73a8c1570fdbc5a947ff09400e68fe6c72925035ad2acb2802a","observation_id":"8b354a31-49bd-4357-9a09-10a6cd7e5e34","resolution":{"observed_at":"2026-08-06T21:52:05.790063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:05.554259Z","title":"Darf: Depth- aware generalizable neural radiance field","venue":null,"work_id":"5d961cd4-cd8a-4a76-bd83-db6fb0867473","year":2025},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:57.082523Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:cc207ef1cc7a18b24a5a767e31d0a301301cd8ba6463763caf4b914f32b43b05","observation_id":"8c0e1250-f422-4fe9-9601-1a08ccdc984d","resolution":{"observed_at":"2026-08-06T21:52:05.620347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-06T21:51:57.234563Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:57.234563Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:d6f6fb6774ee1e2e8f38c3f70a65a2f31041dab51de50106dd1b8a4b889987c1","observation_id":"28917599-655e-4971-8114-058987c3fdcb","resolution":{"observed_at":"2026-08-06T21:51:57.234563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:05.310114Z","title":"Coin: A large-scale dataset for comprehensive instruc- tional video analysis","venue":null,"work_id":"8b38693b-752e-4eee-8474-ecc7beb4382a","year":2019},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:57.360492Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:88806449e2c882ac53b0e16e29e10809dacfeaa515e6e40e22d317183d76ee8e","observation_id":"779064c5-4c2f-41b4-a898-307d77d7c2ca","resolution":{"observed_at":"2026-08-06T21:52:05.432865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:03.490187Z","title":"Dim: Diffusion mamba for efficient high-resolution image synthesis, 2024","venue":null,"work_id":"2b0aeeb1-d91d-4d45-8f30-9035744e7ff0","year":2024},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:57.464332Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:c434bec0cb8b18235b3b56d16900c3789c1aa170610b3259aa10181adda69659","observation_id":"fbdc6a50-7eec-48f7-8c45-b34de633b22f","resolution":{"observed_at":"2026-08-06T21:52:03.938654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-05T00:36:47.095250Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-06T21:51:57.583666Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:57.583666Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:0494c45426d224734008294bf8ead0e4c5d60d475aebed7716c45b3d15d075dc","observation_id":"af449d3e-434b-4f99-ada6-63a5585c1387","resolution":{"observed_at":"2026-08-06T21:51:57.583666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07887","last_updated":"2024-06-12T05:25:15Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T05:25:15Z","title":"An Empirical Study of Mamba-based Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07887","snapshot_observed_at":"2026-08-06T21:51:57.712328Z","title":"An empirical study of mamba-based language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:57.712328Z"},"links":{"cited_paper":"/paper/2406.07887","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:9a5a1cc2b63b3d24b5ededc9ba3c9fe8d36e978f49604491b383142aa95cbd96","observation_id":"0c40be8d-6286-4410-9506-79a9f25f2837","resolution":{"observed_at":"2026-08-06T21:51:57.712328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04256","last_updated":"2025-09-10T06:02:46Z","snapshot_observed_at":"2026-08-03T19:32:12.858219Z","submitted_at":"2024-04-05T17:59:44Z","title":"Sigma: Siamese Mamba Network for Multi-Modal Semantic Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04256","snapshot_observed_at":"2026-08-06T21:51:57.852368Z","title":"Sigma: Siamese mamba network for multi-modal semantic 12 MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:57.852368Z"},"links":{"cited_paper":"/paper/2404.04256","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:f7c69269b949c7591911946386d404f0be9500c25af3d2b33451f56f78273974","observation_id":"a3092b77-db40-4209-bc01-513dabb0a114","resolution":{"observed_at":"2026-08-06T21:51:57.852368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08472","last_updated":"2021-09-17T11:21:34Z","snapshot_observed_at":"2026-07-06T11:48:42.000083Z","submitted_at":"2021-09-17T11:21:34Z","title":"ActionCLIP: A New Paradigm for Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08472","snapshot_observed_at":"2026-08-06T21:51:57.921969Z","title":"Ac- tionclip: A new paradigm for video action recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:57.921969Z"},"links":{"cited_paper":"/paper/2109.08472","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:634ceb5e8931bafce9ed27df2119c9c92ede8ca0caa521a3419b93e809cca4c1","observation_id":"fefb174e-7ad2-4264-838b-62483d589634","resolution":{"observed_at":"2026-08-06T21:51:57.921969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10442","last_updated":"2022-08-31T02:26:45Z","snapshot_observed_at":"2026-07-06T13:44:15.000595Z","submitted_at":"2022-08-22T16:55:04Z","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10442","snapshot_observed_at":"2026-08-06T21:51:58.007202Z","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:58.007202Z"},"links":{"cited_paper":"/paper/2208.10442","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:f22bf3ea993f54cf0de22a1616fa1e8f718f2956f7b30b1c93eaa87b304f697a","observation_id":"897aba94-bd40-4570-a160-c81813c23320","resolution":{"observed_at":"2026-08-06T21:51:58.007202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15463","last_updated":"2024-06-16T15:07:23Z","snapshot_observed_at":"2026-07-06T18:19:17.573250Z","submitted_at":"2024-05-24T11:36:26Z","title":"PoinTramba: A Hybrid Transformer-Mamba Framework for Point Cloud Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15463","snapshot_observed_at":"2026-08-06T21:51:58.110217Z","title":"Pointramba: A hybrid transformer-mamba framework for point cloud analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:58.110217Z"},"links":{"cited_paper":"/paper/2405.15463","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:76478c2f5cb8d77e72835cee870436c9926d1f0e525ab19cdd680011a4e3c137","observation_id":"6cdd6186-d78a-4fba-8888-cf116c13b917","resolution":{"observed_at":"2026-08-06T21:51:58.110217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16302","last_updated":"2025-02-22T17:21:55Z","snapshot_observed_at":"2026-08-07T17:56:11.478269Z","submitted_at":"2025-02-22T17:21:55Z","title":"DualNeRF: Text-Driven 3D Scene Editing via Dual-Field Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16302","snapshot_observed_at":"2026-08-06T21:51:58.193805Z","title":"Dualnerf: Text-driven 3d scene editing via dual- field representation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:58.193805Z"},"links":{"cited_paper":"/paper/2502.16302","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:669dfb73156ffaa8fc839137b8d706acbdfb6ede9e469c558b410e6e45d1a954","observation_id":"94f0fbf7-8e97-43b8-a1e3-e50cb9b47a84","resolution":{"observed_at":"2026-08-06T21:51:58.193805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06430","last_updated":"2023-03-02T08:24:23Z","snapshot_observed_at":"2026-08-07T22:11:50.819752Z","submitted_at":"2022-09-14T05:47:02Z","title":"CLIP-ViP: Adapting Pre-trained Image-Text Model to Video-Language Representation Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.06430","snapshot_observed_at":"2026-08-06T21:51:58.251948Z","title":"Clip- vip: Adapting pre-trained image-text model to video- language representation alignment","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:58.251948Z"},"links":{"cited_paper":"/paper/2209.06430","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:4e455c3c56886ab0efa6f30007925178d35bcb64a7f589ec43f026a58fcd4ee6","observation_id":"7d526405-4e77-4079-a62e-68b17786e9ee","resolution":{"observed_at":"2026-08-06T21:51:58.251948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:03.226162Z","title":"Multiview transformers for video recognition","venue":null,"work_id":"b1d0b622-34ef-4128-8d62-557526f1e8e0","year":2022},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:58.324442Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:a77f1a4185f6ff3c5e5232c4fb267958b47999b1861af50a1ce468a48b87d661","observation_id":"90e734f1-29e5-4dc2-8f66-3a7369f14b76","resolution":{"observed_at":"2026-08-06T21:52:03.304085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06800","last_updated":"2024-03-11T15:17:25Z","snapshot_observed_at":"2026-07-06T17:42:41.349428Z","submitted_at":"2024-03-11T15:17:25Z","title":"MambaMIL: Enhancing Long Sequence Modeling with Sequence Reordering in Computational Pathology","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06800","snapshot_observed_at":"2026-08-06T21:51:58.389943Z","title":"Mambamil: Enhancing long sequence modeling with sequence reordering in computational pathology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:58.389943Z"},"links":{"cited_paper":"/paper/2403.06800","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:8570e617cf9b31d24d175d5713ec79c0ddf9db97cdb20b5b3ec48fa1a75e6eca","observation_id":"68feddfa-c382-4fae-bb7d-49084f20ac09","resolution":{"observed_at":"2026-08-06T21:51:58.389943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:03.065805Z","title":"AIM: Adapting image mod- els for efficient video action recognition","venue":null,"work_id":"233b853b-e175-44d2-b90d-576be559ce2b","year":2023},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:58.460734Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:0d6604b13826c7ecd927f73c76d69a32db05b9166d79995593960585deb7e76e","observation_id":"f2ed0136-122a-4a41-902c-67b430d24944","resolution":{"observed_at":"2026-08-06T21:52:03.146644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:02.869520Z","title":"Multi- modal prototypes for open-world semantic segmen- tation","venue":null,"work_id":"911075d3-b741-493c-819b-83ca73cad7d2","year":2024},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:58.591097Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:1b90ee1f259db8e814a391c32634a0d6c0d9409247f4d9374782cfda179aab93","observation_id":"8c6e1585-036c-4a36-987c-68a3ef9dc655","resolution":{"observed_at":"2026-08-06T21:52:02.959704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:02.667157Z","title":"Remamber: Referring image segmentation with mamba twister","venue":null,"work_id":"0de249b5-056e-4187-8962-62a317486650","year":2024},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:58.763767Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:4d0c3037bd485916b70361e9f5411a3bf4ad603161b4c4b4dd9e7de73008ef47","observation_id":"f07b56a4-579a-47ed-ad1b-744a7fafac25","resolution":{"observed_at":"2026-08-06T21:52:02.772877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:02.510895Z","title":"Learning with multi- class auc: Theory and algorithms","venue":null,"work_id":"40f72c47-740f-4b52-aa72-93c5a8fc7d04","year":2021},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:58.912661Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:f22775c308834a7707c1df6e92905af62103660a394ef3e14a25044a08854f22","observation_id":"c229ec09-62d6-4d04-b8e3-a67848f1fee9","resolution":{"observed_at":"2026-08-06T21:52:02.585717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:02.315704Z","title":"Optimizing two-way partial auc with an end-to-end framework","venue":null,"work_id":"88e2477e-83e1-4b51-b381-e221401636e8","year":2023},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:59.152808Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:6923e1a170a5d94c1c69682bc556253c76f5449460e6078fd4b0883b7bf16085","observation_id":"9a409808-e05f-4f5c-a661-b69f11de62a6","resolution":{"observed_at":"2026-08-06T21:52:02.417014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15343","snapshot_observed_at":"2026-08-06T21:51:59.342925Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:59.342925Z"},"links":{"cited_paper":"/paper/2303.15343","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:d1c0b0a7c2a7435d1c9168e8750e9691d41dc1e16e9de105ece002c20d379373","observation_id":"7cbfadaf-943e-4673-8f37-e4d2aad83fb1","resolution":{"observed_at":"2026-08-06T21:51:59.342925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00762","last_updated":"2024-10-11T07:27:00Z","snapshot_observed_at":"2026-07-06T17:38:13.688025Z","submitted_at":"2024-03-01T18:59:03Z","title":"Point Cloud Mamba: Point Cloud Learning via State Space Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00762","snapshot_observed_at":"2026-08-06T21:51:59.480981Z","title":"Point cloud mamba: Point cloud learning via state space model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:59.480981Z"},"links":{"cited_paper":"/paper/2403.00762","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:4c501f65517f7e891c86ec2e7ff59d269302a6cf017a7e5698b3e99dcf304700","observation_id":"c448c7b1-0717-4d7e-baff-928868910d1e","resolution":{"observed_at":"2026-08-06T21:51:59.480981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01539","last_updated":"2025-06-02T11:05:28Z","snapshot_observed_at":"2026-08-08T06:00:29.569012Z","submitted_at":"2025-06-02T11:05:28Z","title":"G4Seg: Generation for Inexact Segmentation Refinement with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01539","snapshot_observed_at":"2026-08-06T21:51:59.564079Z","title":"G4seg: Generation for inexact segmentation refinement with diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:59.564079Z"},"links":{"cited_paper":"/paper/2506.01539","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:1e37ebd36f6f3cf671762e0ffd23402e2fe81da42cb9357fddef660db3d2e3b8","observation_id":"613a4a46-2840-47e1-a6a4-eb0402e8d530","resolution":{"observed_at":"2026-08-06T21:51:59.564079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:01.960424Z","title":"Vidtr: Video transformer without convo- lutions","venue":null,"work_id":"0deb15f2-dc1c-4bd3-9c42-0edcebc0a280","year":2021},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:59.662077Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:9c34c5baa314fe186e7692ad078347b1e7a1eccab624cd109043b8d94ffa89d3","observation_id":"c101d2c5-237a-4331-8e65-f43b9565ab7e","resolution":{"observed_at":"2026-08-06T21:52:02.118114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:01.698801Z","title":"Regionclip: Region-based language-image pretraining","venue":null,"work_id":"b76b29fd-3d18-405d-b1e6-90e115562f77","year":2022},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:59.733742Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:29fa8549681be11267e123903ab9e1f144a57e1a8a68eeaf9da08d3a23b458fd","observation_id":"8014a4aa-3a2c-4def-8347-74f7b1beac90","resolution":{"observed_at":"2026-08-06T21:52:01.837632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:01.442249Z","title":"Graph-based high-order relation modeling for long-term action recognition","venue":null,"work_id":"2f4f1a9b-edf2-497f-9c65-2b2e1e3ff58a","year":2021},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:59.857627Z"},"links":{"citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:9c761ebdc38f01a2b1d3057d32854d2a168928395ef2a73026809f264901513c","observation_id":"6deeac2c-3a55-4d5d-8cb7-97eb4bc75e57","resolution":{"observed_at":"2026-08-06T21:52:01.571641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09417","last_updated":"2024-11-14T02:00:33Z","snapshot_observed_at":"2026-07-06T17:16:59.193820Z","submitted_at":"2024-01-17T18:56:18Z","title":"Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09417","snapshot_observed_at":"2026-08-06T21:51:59.930418Z","title":"Vi- sion mamba: Efficient visual representation learning with bidirectional state space model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T21:51:59.930418Z"},"links":{"cited_paper":"/paper/2401.09417","citing_paper":"/paper/2506.23283"},"observation_digest":"sha256:0c6695057c51373ca12c7d82463285da5f1f2981ff40096f9d8ccfb55470e23e","observation_id":"ce255339-f313-4b06-8e78-b21533f4e672","resolution":{"observed_at":"2026-08-06T21:51:59.930418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.23283","last_updated":"2025-06-29T15:14:55Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T07:28:03.599688Z","submitted_at":"2025-06-29T15:14:55Z","title":"MoMa: Modulating Mamba for Adapting Image Foundation Models to Video Recognition"},"reference_resolution":{"displayed":89,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":4,"verified_fuzzy":43},"total_outbound_references":89},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 89 of 89 outbound references and 0 inbound Pith citation observations for arXiv:2506.23283."}