{"as_of":"2026-08-13T10:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5fdb47035966e2c93b70b7e74248ae82bac0d9baf954c6312cff63dda3b2df42","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:20:01.720631Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.15459/citation-record","integrity":"/paper/2411.15459/integrity","json":"/paper/2411.15459/citation-record.json","paper":"/paper/2411.15459"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-12T14:20:01.544122Z","title":"Long- former: The long-document transformer","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.544122Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:5e0eed56dea018beaf4dc8b9b0db47a66459ff4cc35e1e9ea9042e6b96dd2fde","observation_id":"a6581c63-6da7-4362-99d1-cb7d782d3f99","resolution":{"observed_at":"2026-08-12T14:20:01.544122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:02.178608Z","title":"Fully-convolutional siamese networks for object tracking","venue":null,"work_id":"b5f19045-e150-4c61-9cfb-a35631957d82","year":2016},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.548262Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:430c62d8190264ab7c685ed339405b3f7410797c3b1b07d22c5176dc604849c7","observation_id":"9dd2fb2c-8096-4ff5-8b7e-265da37e7d88","resolution":{"observed_at":"2026-08-12T14:20:02.181808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:02.169016Z","title":"Learning discriminative model prediction for track- ing","venue":null,"work_id":"42d8f876-91e9-4ca2-9729-0ade0f644247","year":2019},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.551394Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:4d594f599f2ec4981d36870dbb3c73bc78b41e229f1099dfefa4dd0687357a1a","observation_id":"f30c6986-6c06-491d-bba9-9abdf184baf0","resolution":{"observed_at":"2026-08-12T14:20:02.173259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:02.159869Z","title":"Transformer tracking","venue":null,"work_id":"8929e7ec-7a46-4f71-8713-e56421f25b4f","year":2021},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.554839Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:fb82bb0b450ff495d52830c41a49e87b3044d175d649141f7fa033b77e777b6b","observation_id":"f49a0f57-6910-4181-98a0-74b4532cca80","resolution":{"observed_at":"2026-08-12T14:20:02.162868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:01.558719Z","title":"Mixformer: End-to-end tracking with iterative mixed atten- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.558719Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:e69be84e1f05717047c936ff1b22af79e180ca4bdb523bc8cea91871a1c3b068","observation_id":"4fa9e11a-d20c-4404-9ed7-5cb8ec8c3479","resolution":{"observed_at":"2026-08-12T14:20:01.558719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:02.145768Z","title":"Eco: Efficient convolution operators for tracking","venue":null,"work_id":"f4a84c48-0748-4258-97ff-72559c50f227","year":null},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.562494Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:563d3c8135a2c6f2917b716e17c380a32fce0de798e1b2c7e2e04ca6aa372b73","observation_id":"8bf97ae4-53ba-42ea-9ff9-6ee8b80dcc12","resolution":{"observed_at":"2026-08-12T14:20:02.150042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:01.565544Z","title":"Lasot: A high-quality benchmark for large-scale single ob- ject tracking","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.565544Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:0b2799e29418936976813078efe91895f9d43ff4d780d8b29873ecec3261c68e","observation_id":"8181d726-7c28-4ac5-ba72-9e7dc704893d","resolution":{"observed_at":"2026-08-12T14:20:01.565544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02048","last_updated":"2021-04-05T18:03:24Z","snapshot_observed_at":"2026-08-13T01:21:19.615890Z","submitted_at":"2019-12-04T15:16:32Z","title":"Siamese Natural Language Tracker: Tracking by Natural Language Descriptions with Siamese Trackers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02048","snapshot_observed_at":"2026-08-12T14:20:01.568536Z","title":"Robust visual object tracking with natural language region proposal network","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.568536Z"},"links":{"cited_paper":"/paper/1912.02048","citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:8baea222a8214d4e5cdef2e48ee42dcbe465aa8832b73ad558a8d8e52ae50641","observation_id":"ae09d6b5-30dd-4372-b1ab-ebb5e54f4606","resolution":{"observed_at":"2026-08-12T14:20:01.568536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:02.131688Z","title":"Real-time visual object tracking with natural lan- guage description","venue":null,"work_id":"e72d2409-2fe1-498d-88eb-07b5eae0321f","year":2020},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.572867Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:a43d4fa4123a32179359c91203c951fbe7be83cbe1509d36a8d93c0e339e9ec2","observation_id":"57470215-477e-40d7-8267-55067c18dacb","resolution":{"observed_at":"2026-08-12T14:20:02.134905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:02.122611Z","title":"Siamese natural language tracker: Tracking by natural lan- guage descriptions with siamese trackers","venue":null,"work_id":"f80f3a54-634f-48d5-936c-8e6e206c4196","year":2021},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.576484Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:890e369359eef48598f0c94878663bdce7dba24c6434d5c31f29a864b8a314bd","observation_id":"1d6ea254-fd70-4f8e-a343-e45693357589","resolution":{"observed_at":"2026-08-12T14:20:02.125997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:02.113947Z","title":"Hungry hungry hippos: To- wards language modeling with state space models","venue":null,"work_id":"cb7fbdfc-bc55-479d-aac5-2e2873469e7f","year":2022},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.580176Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:f2823d5f949e7590ce68263db9db9bf3adc98e963495bd2c385261f0114ccbaf","observation_id":"c14e1255-552f-4572-9c2e-41e5d40f1dc2","resolution":{"observed_at":"2026-08-12T14:20:02.117325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:02.105558Z","title":"Stmtrack: Template-free visual tracking with space-time memory networks","venue":null,"work_id":"117d8240-5237-4fba-8105-b55568fbe265","year":2021},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.583728Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:a02482df8ec449a0735647eb05bef8ad038e25a4f2368c47fc0dcccaad14bd96","observation_id":"52ba6913-936f-46bb-a3c9-ababb534a261","resolution":{"observed_at":"2026-08-12T14:20:02.108752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:02.096947Z","title":"Generalized relation modeling for transformer tracking","venue":null,"work_id":"abd5584e-2d7a-47c5-9b32-a4225be67008","year":2023},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.586708Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:0bb0aa656afc3fec1eed19027ff3c84a164839302d7872df5d1f0920123c7322","observation_id":"d65da1bc-3c72-46a5-91ba-83adef6e77eb","resolution":{"observed_at":"2026-08-12T14:20:02.100081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-12T14:20:01.589615Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.589615Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:76d9b8e535aaae08656347c5c699272f4045260bcca82d07e0aa766841099519","observation_id":"6c3e1075-1a27-40e2-98df-385da687db40","resolution":{"observed_at":"2026-08-12T14:20:01.589615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:02.088746Z","title":"Efficiently mod- eling long sequences with structured state spaces","venue":null,"work_id":"8596e3d2-87a2-4cd8-b4cc-17f8c96ab10a","year":2021},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.592732Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:19d21c8e47753492d8a83426b03c3226d1300996c76afe48cfb17b187a84ade4","observation_id":"b2a870ee-c7f5-4644-89be-513fbf5718b2","resolution":{"observed_at":"2026-08-12T14:20:02.092058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:01.595970Z","title":"Combining recurrent, convolutional, and continuous-time models with linear state space layers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.595970Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:4fbbd11eeda3e07d1f5ac7eea3b5208521fe5afc53541cc1676250ca8fc9e765","observation_id":"0609f4d3-4151-49de-90ff-1cbec8a71231","resolution":{"observed_at":"2026-08-12T14:20:01.595970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:01.598955Z","title":"On the parameterization and initialization of diagonal state space models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.598955Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:6b72d3c2e4f3e78fe3b241ec8682ca9c4079a040cf22de9961a114d11f9f6d11","observation_id":"af42b50c-e536-4b5c-87b0-7f2cc8fa3c63","resolution":{"observed_at":"2026-08-12T14:20:01.598955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:01.601871Z","title":"Mambair: A simple baseline for image restoration with state-space model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.601871Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:9307569cd619a3a2febd2f74d1b5c888007f203b1e64433acfe7dbee0584c6ff","observation_id":"fdfa493b-397c-484d-987b-d830f387c830","resolution":{"observed_at":"2026-08-12T14:20:01.601871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:02.064846Z","title":"Divert more attention to vision-language tracking","venue":null,"work_id":"c37a8db7-de8c-4723-931a-831877b6701f","year":null},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.604784Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:08f366396d654e5c4f70a713317e63394a90080fbc8faff2040588172acb8997","observation_id":"0d24d2ca-49b5-4a07-b55b-8a9bd4a5197d","resolution":{"observed_at":"2026-08-12T14:20:02.068064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16605","last_updated":"2024-12-02T08:41:46Z","snapshot_observed_at":"2026-08-12T23:57:44.722136Z","submitted_at":"2024-05-26T15:31:09Z","title":"Demystify Mamba in Vision: A Linear Attention Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16605","snapshot_observed_at":"2026-08-12T14:20:01.608104Z","title":"Demystify mamba in vision: A linear attention perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.608104Z"},"links":{"cited_paper":"/paper/2405.16605","citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:319641f5c0e983b48146e1ac7427dbcf1384e314b6d3516c4868f49b72a49178","observation_id":"300d66d5-3d69-4d8d-b254-b7218fe9d833","resolution":{"observed_at":"2026-08-12T14:20:01.608104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06564","last_updated":"2025-03-09T15:56:38Z","snapshot_observed_at":"2026-08-13T00:33:55.604402Z","submitted_at":"2024-04-09T18:28:55Z","title":"MambaAD: Exploring State Space Models for Multi-class Unsupervised Anomaly Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06564","snapshot_observed_at":"2026-08-12T14:20:01.611489Z","title":"Mambaad: Exploring state space models for multi-class unsupervised anomaly detec- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.611489Z"},"links":{"cited_paper":"/paper/2404.06564","citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:2ec9f168b4d8f2228d23e27ac8edba7162336f5e6d19ec2c949eafce7b94f0a4","observation_id":"61d363e2-8650-4f9c-95e8-a155e8b296c8","resolution":{"observed_at":"2026-08-12T14:20:01.611489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:02.056123Z","title":"High-speed tracking with kernelized correlation fil- ters","venue":null,"work_id":"3ad5bd90-7490-454a-b9e6-79a7d9c4ec6b","year":2014},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.614864Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:f677a93a12acb92fc1b6962b2c75129357c82cf72487ae6ee2806e74384f71b1","observation_id":"028492ef-d463-4afc-ba58-9a768c3584ca","resolution":{"observed_at":"2026-08-12T14:20:02.059423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:02.046406Z","title":"A multi-modal global instance tracking benchmark (mgit): Better locating target in complex spatio-temporal and causal relationship","venue":null,"work_id":"cbf2f562-61e2-4aa1-b0b7-d63c34d6a1b0","year":2024},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.617841Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:91dd28752d48fb93938081657465d0d8f49e9818ce4818d9cb331ef6649ebb08","observation_id":"a9d49dbb-20d5-4d17-a7dd-1e83c68e2e12","resolution":{"observed_at":"2026-08-12T14:20:02.050178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:02.036597Z","title":"Got-10k: A large high-diversity benchmark for generic object tracking in the wild","venue":null,"work_id":"d5db0987-44bf-4d33-a204-4ab7e4b3a2f9","year":2019},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.620570Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:98c0e54411d9623e1f27b4c20e9f3542d1dde3ba20e54f97c8f8eeb5c761c5cc","observation_id":"e66ed6a9-f12e-40a1-a5f3-72b75b7224a4","resolution":{"observed_at":"2026-08-12T14:20:02.040139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:01.623287Z","title":"High performance visual tracking with siamese region pro- posal network","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.623287Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:67be3ce1e0d56ed8079c24c0f55d69d689fe1fa7f65de57d54a5c84bae09b3ad","observation_id":"abcc008d-4975-4f85-9c1e-529f71ce5104","resolution":{"observed_at":"2026-08-12T14:20:01.623287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:02.021115Z","title":"Siamrpn++: Evolution of siamese vi- sual tracking with very deep networks","venue":null,"work_id":"4c0b928c-24cf-4466-be91-d51f630dafe5","year":2019},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.627029Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:043f0306a7a6c6be06be438b04345eb3dd91fcb990b87e06fc84a2138bad3fe2","observation_id":"5c9d99d7-0374-4249-81a0-f8ac8f4ecec4","resolution":{"observed_at":"2026-08-12T14:20:02.025986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06977","last_updated":"2024-03-12T15:22:52Z","snapshot_observed_at":"2026-08-13T00:57:21.237233Z","submitted_at":"2024-03-11T17:59:34Z","title":"VideoMamba: State Space Model for Efficient Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06977","snapshot_observed_at":"2026-08-12T14:20:01.630113Z","title":"Videomamba: State space model for efficient video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.630113Z"},"links":{"cited_paper":"/paper/2403.06977","citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:aad9ddcddcbc61a923f629be32c0eb7897e693ff1db4a75936eab9479a85b7cc","observation_id":"5adcd7d7-0fd3-4c44-b089-585491d537f2","resolution":{"observed_at":"2026-08-12T14:20:01.630113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18014","last_updated":"2024-05-29T05:19:15Z","snapshot_observed_at":"2026-08-12T23:56:19.542787Z","submitted_at":"2024-05-28T09:57:03Z","title":"Coupled Mamba: Enhanced Multi-modal Fusion with Coupled State Space Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18014","snapshot_observed_at":"2026-08-12T14:20:01.633620Z","title":"Cou- pled mamba: Enhanced multi-modal fusion with coupled state space model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.633620Z"},"links":{"cited_paper":"/paper/2405.18014","citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:c1a15b8827009f9aa98146e6ac2d06eee98653e34286365aa16e8d67729dcecc","observation_id":"6099526f-d93d-4be3-9c6d-dfc03239752e","resolution":{"observed_at":"2026-08-12T14:20:01.633620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:02.012397Z","title":"Cross- modal target retrieval for tracking by natural language","venue":null,"work_id":"7ba3ae14-767b-4b19-baf7-2b5c0da78774","year":2022},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.636982Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:5874f39d699e6edbdfc364c2348f9d74c3649a540735395922841da732a98941","observation_id":"728fedc6-303c-4b87-8af9-30e0d4c51114","resolution":{"observed_at":"2026-08-12T14:20:02.015505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:01.639871Z","title":"Tracking by natural language specification","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.639871Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:04578331468e732dfd2db5c0fdc3a86a571ca53afd146fae4aa0df23ae6445ee","observation_id":"98df1291-0654-4c4d-8b92-b1f54915966c","resolution":{"observed_at":"2026-08-12T14:20:01.639871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:01.997171Z","title":"MTMamba: Enhancing multi-task dense scene understanding by mamba-based de- coders","venue":null,"work_id":"a1d367d3-e066-441c-be17-765e0243142e","year":2024},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.643134Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:c81fc1a425a613f5a0661d40a052cf30741fc713433ffa04858725f9299a7902","observation_id":"74d970e1-2326-4893-9a36-9d851db40bcc","resolution":{"observed_at":"2026-08-12T14:20:02.001461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:01.985951Z","title":"Swintrack: A simple and strong baseline for trans- former tracking","venue":null,"work_id":"a77cc425-37b9-4c01-b33a-979b71bfaf90","year":2022},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.645985Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:0ac28a87510f11e5a71160e1dbd54fda5c2f83fcfa3bf31d3258a771ae16fd11","observation_id":"48b519f6-27a5-4f43-9076-c2abea571e20","resolution":{"observed_at":"2026-08-12T14:20:01.990328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10166","last_updated":"2024-12-29T14:57:13Z","snapshot_observed_at":"2026-07-06T17:17:31.008185Z","submitted_at":"2024-01-18T17:55:39Z","title":"VMamba: Visual State Space Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10166","snapshot_observed_at":"2026-08-12T14:20:01.649090Z","title":"Vmamba: Visual state space model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.649090Z"},"links":{"cited_paper":"/paper/2401.10166","citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:66d7c7824e30c95dbd18041c331fc99b5e08aa33ccaa3116d75215efccf6855d","observation_id":"355e5ee0-c2b1-4e87-bbc8-c4bc297017de","resolution":{"observed_at":"2026-08-12T14:20:01.649090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:01.652546Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.652546Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:980df64b29660605e3f1d0b14cb0ad4aaae192f6a000446802973c9ae9461e41","observation_id":"e81b9aad-2ddc-401f-8b03-9df689d56cad","resolution":{"observed_at":"2026-08-12T14:20:01.652546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:01.970987Z","title":"Unifying visual and vision-language tracking via contrastive learning","venue":null,"work_id":"5a894df5-26bf-4b39-9b87-a8c0eb7807f0","year":2024},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.655452Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:f0e4caa789e01e37a725c897356bb0e76a7e3bcd3e01e39d20e99c74d3fa766d","observation_id":"deeb7364-25fe-410e-acb3-bb29b85d01db","resolution":{"observed_at":"2026-08-12T14:20:01.974955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:01.658639Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.658639Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:39c98e169a69ff9c57f8521ca3699ac6b0cdeb8459a70039f11c4053bef77aaf","observation_id":"f99182f9-a5e9-4931-ac73-4f59d7fab7da","resolution":{"observed_at":"2026-08-12T14:20:01.658639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.13947","last_updated":"2022-07-02T17:58:04Z","snapshot_observed_at":"2026-07-06T13:25:27.826746Z","submitted_at":"2022-06-27T01:50:18Z","title":"Long Range Language Modeling via Gated State Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.13947","snapshot_observed_at":"2026-08-12T14:20:01.662622Z","title":"Long range language modeling via gated state spaces","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.662622Z"},"links":{"cited_paper":"/paper/2206.13947","citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:b97a3c389835f7c3bdb88b28417cb52d7f137e8a0a32f6259b225220abdb5093","observation_id":"dd85b160-767a-490e-8d47-3020cd2b1f7e","resolution":{"observed_at":"2026-08-12T14:20:01.662622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:01.956609Z","title":"Learning multi-domain convolutional neural networks for visual tracking","venue":null,"work_id":"ae3516b4-9fc7-497b-824e-9fa3e965c2f5","year":2016},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.666664Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:508bec4c17fce795c0babb420cfd4b258687aef1f6149143a406e48d6adf4124","observation_id":"4df67e8a-c9ff-485c-84fa-4dbe85e2776f","resolution":{"observed_at":"2026-08-12T14:20:01.960683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:01.948126Z","title":"Context-aware integration of lan- guage and visual references for natural language tracking","venue":null,"work_id":"ed950c4e-ea95-4ece-b475-9b757f439c68","year":2024},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.669880Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:020c70496674b0f703928cda2e18792950aeaa3892d190ecaeb9bef21779b2e8","observation_id":"fd97c461-71e7-4c1e-9049-546836d36abb","resolution":{"observed_at":"2026-08-12T14:20:01.951243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14174","last_updated":"2024-05-23T04:59:49Z","snapshot_observed_at":"2026-08-13T00:00:59.256033Z","submitted_at":"2024-05-23T04:59:49Z","title":"Multi-Scale VMamba: Hierarchy in Hierarchy Visual State Space Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14174","snapshot_observed_at":"2026-08-12T14:20:01.673803Z","title":"Multi-scale vmamba: Hierarchy in hierarchy visual state space model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.673803Z"},"links":{"cited_paper":"/paper/2405.14174","citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:67ff6b52652fb13dd616cfcac4930e7973c0d0434bc8df54507fd0ed06584376","observation_id":"c7707fe5-cfa6-46e8-8e09-f698e646a1e9","resolution":{"observed_at":"2026-08-12T14:20:01.673803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:01.939678Z","title":"Simplified state space layers for sequence model- ing","venue":null,"work_id":"eba00dc8-c988-4da7-b5d9-67e9ab237240","year":null},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.677927Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:0a99b93a8e938cd636690eac3a136f9a3abbd796dec7a836b970ea5feb62f58a","observation_id":"bb2cd656-518e-4d52-a50a-1f91343ffbc7","resolution":{"observed_at":"2026-08-12T14:20:01.943019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:01.931174Z","title":"Fast template matching and update for video object tracking and segmentation","venue":null,"work_id":"dbb811cc-8fdc-4243-88d9-18c0f3e4f509","year":2020},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.681010Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:5e0bf25cc7b68467c5cdd9c9cd9b039318e0f0eb2f950940510f4093341b36df","observation_id":"8163d3bf-69a2-445d-b2aa-6a7fca3820d6","resolution":{"observed_at":"2026-08-12T14:20:01.934590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:01.922399Z","title":"Transformer meets tracker: Exploiting temporal context for robust visual tracking","venue":null,"work_id":"99359255-e034-4ca9-b086-d39cc2e209a3","year":2021},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.684047Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:09353a5de6315a30439b4242baae700fd3109f08f830d6d2adf996027dce00b0","observation_id":"9ab72c60-ba61-4856-b2c4-d80099f52fe2","resolution":{"observed_at":"2026-08-12T14:20:01.925530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:01.913962Z","title":"Towards more flexible and accurate object tracking with natural language: Algo- rithms and benchmark","venue":null,"work_id":"d3ef1401-5945-46da-8c9b-7df2dd02b965","year":2021},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.687386Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:e92675f03a9c193418d4976f0b9440612fe6f44be3b03f6cc06f68d98bd63d84","observation_id":"fae2b7b6-ed6c-4e61-8012-98bcb3e3d0c4","resolution":{"observed_at":"2026-08-12T14:20:01.917419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16105","last_updated":"2024-05-25T07:31:49Z","snapshot_observed_at":"2026-08-12T23:58:15.952026Z","submitted_at":"2024-05-25T07:31:49Z","title":"MambaLLIE: Implicit Retinex-Aware Low Light Enhancement with Global-then-Local State Space","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16105","snapshot_observed_at":"2026-08-12T14:20:01.690659Z","title":"Mamballie: Implicit retinex-aware low light enhancement with global-then-local state space","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.690659Z"},"links":{"cited_paper":"/paper/2405.16105","citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:b6ffc920eb3e52b68b074aa48dc8a6464792874cb225c35c6f0dd147a0e3fc37","observation_id":"4bb6b9a7-8050-43c3-ae9a-b1f873567280","resolution":{"observed_at":"2026-08-12T14:20:01.690659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:01.904625Z","title":"Siamfc++: Towards robust and accurate visual tracking with target estimation guidelines","venue":null,"work_id":"f2a6e60b-cbbc-412e-bf9a-cf87fd3e5a3b","year":2020},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.694007Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:44360a4ae4102ab89f84011263aad01ae177a61fefe05436daeca09cee0003bd","observation_id":"9f4d9c95-edb4-4d2e-a23e-7baea397b7cd","resolution":{"observed_at":"2026-08-12T14:20:01.908175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:01.895750Z","title":"Learning dynamic mem- ory networks for object tracking","venue":null,"work_id":"ea2f16ac-da09-44b9-ac54-e3a2e08e91ac","year":2018},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.696798Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:47ae5428a3ecf75337eb099381bc865b665031baf026e7ea805c9a74aa63b212","observation_id":"dc204745-316b-43b0-a1c7-3439150e22c1","resolution":{"observed_at":"2026-08-12T14:20:01.899060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:01.887368Z","title":"Grounding-tracking-integration","venue":null,"work_id":"4f7c30c9-1ed3-421d-a2f2-9169379a9299","year":2020},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.699953Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:b1510a9ff1c604d26c80d0f3e5e6c467a08b3537531435332c11b8727af61a06","observation_id":"40b3d93b-bb3d-4665-8ac0-c45c2f0b7d2c","resolution":{"observed_at":"2026-08-12T14:20:01.890476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:01.878507Z","title":"Joint feature learning and relation modeling for tracking: A one-stream framework","venue":null,"work_id":"9b920c65-5767-4ca6-a333-25cefb64586d","year":2022},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.703010Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:09ae0e33b8322687cc858909549ad5b5fac8f9c11980a4ce5e48b5cdf346baff","observation_id":"4db2eb79-5d11-4566-9d97-bfd2b92375f5","resolution":{"observed_at":"2026-08-12T14:20:01.881755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:01.869738Z","title":"Object track- ing: A survey","venue":null,"work_id":"e54643fc-1662-417c-b9ee-7c3c407c1d61","year":null},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.705945Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:3564e98154178d059c7e7657f41b8663bef50bb7f4a005857672877708cd0120","observation_id":"7c4f2322-1be1-4234-8f7c-a0e7b4b8c8c2","resolution":{"observed_at":"2026-08-12T14:20:01.872687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02315","last_updated":"2024-10-10T03:15:55Z","snapshot_observed_at":"2026-08-12T23:30:21.714677Z","submitted_at":"2024-07-02T14:48:18Z","title":"VFIMamba: Video Frame Interpolation with State Space Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02315","snapshot_observed_at":"2026-08-12T14:20:01.709076Z","title":"Vfimamba: Video frame interpolation with state space models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.709076Z"},"links":{"cited_paper":"/paper/2407.02315","citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:a23f8ce44f3418748f90a0005a1810fe1421f0923161fbac17bea88b4be30049","observation_id":"f97e2aee-3c2f-4b43-b45f-d1a3edcd877b","resolution":{"observed_at":"2026-08-12T14:20:01.709076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:01.860032Z","title":"Learn to match: Automatic matching network design 10 for visual tracking","venue":null,"work_id":"361aad4a-0979-4a8f-b795-c958d286a040","year":null},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.712704Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:3d26cb1e4f8ba5ce9f1e46c82149f6c9c2eba5be414037e918a4de008bce7c25","observation_id":"d9af8241-1c4c-4c1b-be10-4e786bb577cd","resolution":{"observed_at":"2026-08-12T14:20:01.863568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:01.851079Z","title":"Joint visual grounding and tracking with natural language specifi- cation","venue":null,"work_id":"fd8c7c49-3547-4eac-9a1a-58825e47c15a","year":null},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.716871Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:7fd4e01fc79a1e36be430d600a6942269fe7483632dc2b0dfadf2d32ce772883","observation_id":"f064469c-6e1b-4b67-9fad-8a97627fa7df","resolution":{"observed_at":"2026-08-12T14:20:01.854384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:20:01.840317Z","title":"Vision mamba: Efficient visual representation learning with bidirectional state space model","venue":null,"work_id":"52bc0358-657a-4642-87a9-4040c23317d0","year":2024},"citing_paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T14:20:01.720631Z"},"links":{"citing_paper":"/paper/2411.15459"},"observation_digest":"sha256:e144f6dde8b66e55056f82b768fd72ec9a32ae71c41e55ee687dfc6128da14f5","observation_id":"4f811161-bb32-43ac-906e-2f40a87e6f66","resolution":{"observed_at":"2026-08-12T14:20:01.845324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.15459","last_updated":"2024-11-23T05:31:58Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T23:44:15.567231Z","submitted_at":"2024-11-23T05:31:58Z","title":"MambaVLT: Time-Evolving Multimodal State Space Model for Vision-Language Tracking"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2411.15459."}