{"as_of":"2026-08-07T13:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d0f6e9281d44e669efa9d18c3857e70809258f68f5a38b1ef1d88c1667ed5817","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:09:51.180396Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.16624/citation-record","integrity":"/paper/2507.16624/integrity","json":"/paper/2507.16624/citation-record.json","paper":"/paper/2507.16624"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.580524Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":"761c4588-68cb-4e6f-b99d-6dc53ec8e3a0","year":2021},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:41.911512Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:f365df971e13d8305f0a088ee6138fb9621ed48ef1a2805dc74aefedebfff6d8","observation_id":"ba1fdd7c-b8ef-4ae5-b875-624c69aac48e","resolution":{"observed_at":"2026-08-06T15:09:52.587508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:50.764415Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.764415Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:f002c1fd7570869d7b03439b7ebd1c3a3e22e09a529e3bc82ea9c7faa6fb7064","observation_id":"9fd7222a-87d3-49fc-ae91-5ee4fd5d73b3","resolution":{"observed_at":"2026-08-06T15:09:50.764415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.544613Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":"0d02ae99-fe15-4b26-9afe-a24031725334","year":2021},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.772564Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:0a4f9f68d99af765ebc505dadb70b2ee85c5751341ab7150d9e0800bd266daac","observation_id":"5a0c9534-c898-4c96-ae12-cde4dc06bb54","resolution":{"observed_at":"2026-08-06T15:09:52.553586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.525366Z","title":"Cswin transformer: A general vision transformer back- bone with cross-shaped windows,","venue":null,"work_id":"fe2576a5-0d65-4104-b567-c688931ba63b","year":2022},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.779726Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:b5024f3cf54f799327eebf4006f7ac6e6cf70b9e077147d1e01eac8563355683","observation_id":"91e928d6-afbe-4b30-bf04-4f5c6f7c0741","resolution":{"observed_at":"2026-08-06T15:09:52.530805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.504921Z","title":"Neighborhood attention transformer,","venue":null,"work_id":"b7174bfd-f062-436d-81de-6dc0b241ceff","year":2023},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.790747Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:2cf762a5ef697decfa2e48ccf237109ec0533a4c830efd4a6952614423edfe42","observation_id":"90bb7a0d-0293-48c4-a2cf-ad55cc744dcd","resolution":{"observed_at":"2026-08-06T15:09:52.511526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.483902Z","title":"Biformer: Vi- sion transformer with bi-level routing attention,","venue":null,"work_id":"53cd8129-8e77-412b-8c3c-96bf72575003","year":2023},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.801983Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:3a362911e63a5b4331bb32c4ee7803d4840612a02a319da02faa3841a95513a2","observation_id":"e194ed73-7e65-44b9-aa32-fb0e5c0e8b24","resolution":{"observed_at":"2026-08-06T15:09:52.490935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.467215Z","title":"Pyramid vision transformer: A versatile backbone for dense prediction without convolutions,","venue":null,"work_id":"9ef43889-3ae9-448a-9165-55905cb41314","year":2021},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.813550Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:b2107b758b3795a03fae21789f5b7430781d1bb0552eafd99458ea64ffc2b64a","observation_id":"69600ac6-8669-4edd-89a7-9e1767173642","resolution":{"observed_at":"2026-08-06T15:09:52.472142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.450831Z","title":"Pvt v2: Improved baselines with pyramid vision transformer,","venue":null,"work_id":"e7b972cb-1893-48d0-81cf-ed99a0cdf995","year":2022},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.822220Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:6e52ad04d54276e8b8825b3e45d169b2212ca271c58a7c9cb1d901ba3ecb7adc","observation_id":"48ea8bfe-c03a-46a9-b463-4c3e6dc5c8fc","resolution":{"observed_at":"2026-08-06T15:09:52.456654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.431564Z","title":"P2t: Pyramid pool- ing transformer for scene understanding,","venue":null,"work_id":"da111e34-ed07-40eb-b3f3-e127b9672d14","year":2023},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.828936Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:7673d20d2be3d06d782d379137b70e4c4c9e143a9ff7994f4617c9a41860fe49","observation_id":"42af6379-759d-4df4-a9ba-3f52adeea1f4","resolution":{"observed_at":"2026-08-06T15:09:52.438189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.410389Z","title":"Maxvit: Multi-axis vision transformer,","venue":null,"work_id":"982510a2-2b32-4463-a1c1-b24fc4e6a94d","year":2022},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.836228Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:fbd01559d875ec76665f1b6d5316ba7855f916d40e87804bb7cfe67ba18cf79f","observation_id":"e2a9d607-f532-44de-be37-c92db3b21012","resolution":{"observed_at":"2026-08-06T15:09:52.416711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15001","last_updated":"2023-01-16T18:58:58Z","snapshot_observed_at":"2026-08-04T04:56:00.219481Z","submitted_at":"2022-09-29T17:57:08Z","title":"Dilated Neighborhood Attention Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15001","snapshot_observed_at":"2026-08-06T15:09:50.841599Z","title":"Dilated neighborhood attention trans- former,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.841599Z"},"links":{"cited_paper":"/paper/2209.15001","citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:121f95a04cd263c58f058179a3dafd14502b46a1c7800d7bc4b6013eadd4e6bd","observation_id":"425f7171-96a9-4ff0-bf45-25fcb391a43f","resolution":{"observed_at":"2026-08-06T15:09:50.841599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.391665Z","title":"Crossformer++: A versatile vision transformer hinging on cross-scale attention,","venue":null,"work_id":"71576667-de5e-4872-b1a7-8adde138c9e5","year":2023},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.849000Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:7f7868df38a8f53dc1f25eddd1f98af88b4345e81fcf8323c0a42a5386b9d60b","observation_id":"eb1f1f34-e488-40a4-a43d-61924b7f96db","resolution":{"observed_at":"2026-08-06T15:09:52.397720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.373656Z","title":"Mamba: Linear-time sequence modeling with selective state spaces,","venue":null,"work_id":"bc4c2ba9-d53d-47bb-bf0f-4e48ac0bfb15","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.854165Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:247a79046c06230c0e73553829ed82cb4ed0ed22ac59eb907ed6afa4408177d8","observation_id":"972e4b1f-57f5-4cff-a704-5540e80333e5","resolution":{"observed_at":"2026-08-06T15:09:52.378973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.356343Z","title":"Vision mamba: Efficient visual representation learning with bidirectional state space model,","venue":null,"work_id":"4d2fb65e-c565-4033-99ef-dd9e6b2a7bec","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.859331Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:5d9f8a429cda78e26b8953e0562c8cf612d6a6662eea8b10c8d3e096751cac30","observation_id":"fda5f9af-b025-4671-8c11-1e061f9781c6","resolution":{"observed_at":"2026-08-06T15:09:52.362085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.338688Z","title":"Vmamba: Visual state space model,","venue":null,"work_id":"5a53ba0f-a742-4049-babc-cd08a8bd20ca","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.864490Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:4883bb6a9536bfae34acd2f6941f1e02f11f73c15d6920d6c9b653ed0b7e6877","observation_id":"f7038946-8832-44ce-a7f3-0e16ff3b39b0","resolution":{"observed_at":"2026-08-06T15:09:52.343974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.318196Z","title":"Local- mamba: Visual state space model with windowed selective scan,","venue":null,"work_id":"427ff6e8-f705-4328-a200-cabf836ed788","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.869967Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:3f6fbdb55dc8b85db233f4581b3314dd86abb30d98c10172a6ae49c9e4b63449","observation_id":"ef7d6c22-1b9c-4e94-b8d7-c9937863cd15","resolution":{"observed_at":"2026-08-06T15:09:52.326198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.297165Z","title":"Plainmamba: Improving non-hierarchical mamba in visual recognition,","venue":null,"work_id":"1319f781-c522-43b6-b174-07e9b39a6966","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.875035Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:d59bcf37538815d8bd88c1c4ca8ed592d5832d74adcbc40719c1b771be237e75","observation_id":"23405231-0106-4be3-aa04-624a87bafbdb","resolution":{"observed_at":"2026-08-06T15:09:52.302606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.279982Z","title":"Efficientvmamba: Atrous selective scan for light weight visual mamba,","venue":null,"work_id":"5d028ca2-0ec0-49b5-b18b-d1ec8a6334c6","year":2025},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.880636Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:cac14d2bf50fbb5b6630cd5c60a227cd9ed6d9d5a14a7aa652ef3908478ae234","observation_id":"d6351ae5-d90f-4a5a-ba72-e57c5cba56d4","resolution":{"observed_at":"2026-08-06T15:09:52.285332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.261781Z","title":"Spatial- mamba: Effective visual state space models via structure-aware state fusion,","venue":null,"work_id":"3a3d2ac0-45ef-4e45-b688-ce8765f98e27","year":2025},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.885483Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:463cd19354e7ef5397946a02be8d31f56b444c3b6e2df1b8836509f405a63446","observation_id":"5d5a3d7c-0e70-4714-bcc4-b83f500f290f","resolution":{"observed_at":"2026-08-06T15:09:52.268053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.244398Z","title":"Sparx: A sparse cross-layer connec- tion mechanism for hierarchical vision mamba and transformer networks,","venue":null,"work_id":"a2cee3f7-78e6-4337-acc2-15645aed1182","year":2025},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.889642Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:085133d3a26292fc9942d60467ff847dedea57dd7789406be8b551d0dafd1fde","observation_id":"ca6aa5af-2f29-47b1-a327-38d439e0e016","resolution":{"observed_at":"2026-08-06T15:09:52.250146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.229053Z","title":"Mambaout: Do we really need mamba for vision?,","venue":null,"work_id":"6db75a6f-0585-4aed-89bb-16c2c8155714","year":2025},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.894039Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:dab5dde085693b636fdc7829380eebe2925dce6e4353f469787eedbb88562c72","observation_id":"f8bdf14b-006b-4c1d-9e15-d4a510ae5670","resolution":{"observed_at":"2026-08-06T15:09:52.234059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.209857Z","title":"Mambavision: A hybrid mamba- transformer vision backbone,","venue":null,"work_id":"e08946bb-c3c6-4c28-920b-94abab8bb255","year":2025},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.898492Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:63fcc308b69c123e45d4d9900d6bf4c1994246a9ad83234f434020eb2945f2dc","observation_id":"6368990a-c1ab-47c8-b502-0282822c9fcf","resolution":{"observed_at":"2026-08-06T15:09:52.216562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.190602Z","title":"Demystify mamba in vision: A linear attention perspective,","venue":null,"work_id":"97d18e3b-043b-4f1a-a895-baa13098129f","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.903379Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:c95c4ac8d1b01ed54e76c97afdec577d0f5dfe6e9ff217cef73d9fabb77c4c60","observation_id":"6a5ba455-6841-4422-a19f-c1a49a949798","resolution":{"observed_at":"2026-08-06T15:09:52.197316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.174422Z","title":"Metaformer baselines for vision,","venue":null,"work_id":"6e02c214-19f9-4dc0-a579-7ee4aca4757d","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.908617Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:c8881b9cccb4c939f410f3def32dac7c0e2dedaf3e6c2674619d8a14de3ea1e5","observation_id":"b55cebee-0fea-45c4-9841-54e174216143","resolution":{"observed_at":"2026-08-06T15:09:52.179234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.155723Z","title":"Rmt: Retentive networks meet vision transformers,","venue":null,"work_id":"dc4accba-4bca-407e-a74f-a478ac268e31","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.912995Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:e2db6d554f8c660348361129164fb81e97f35474b813232911a829321a575f1a","observation_id":"c1f11d95-901e-4b9e-a2cb-7e116bb1f065","resolution":{"observed_at":"2026-08-06T15:09:52.161542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.139325Z","title":"Transnext: Robust foveal visual perception for vision transformers,","venue":null,"work_id":"8c49acbb-cc2e-4648-bf4c-fce1a5aab39b","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.917535Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:00dc0f017ec28c3400b9b90f7e95f49c0938ea7477b1e4e95b876b62fac81569","observation_id":"7a1b6fdc-d592-462e-b1e5-baeb59967042","resolution":{"observed_at":"2026-08-06T15:09:52.144547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.121413Z","title":"Segman: Omni-scale context modeling with state space models and local attention for semantic segmen- tation,","venue":null,"work_id":"5789b87f-b8ac-4576-aa4b-ffce7664112b","year":2025},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.922415Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:dd4c4b6b80ce32cafc09a6fe0ccced0a7e7e3206d76853860ecd6d386c87789c","observation_id":"c283b729-c639-4132-b377-402c337976f7","resolution":{"observed_at":"2026-08-06T15:09:52.127454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.104402Z","title":"Unified perceptual parsing for scene understanding,","venue":null,"work_id":"831007b8-bbf6-46c9-a2b7-ba53fba0d922","year":2018},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.927031Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:6df7875a3131a11dac4ab61304a7806323a96d079009f8ca6a7d1bba7642bc46","observation_id":"6e1883ae-0c0d-4f15-bd0b-554fe884baa4","resolution":{"observed_at":"2026-08-06T15:09:52.110031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.086721Z","title":"Cascade r-cnn: High quality object detection and instance segmentation,","venue":null,"work_id":"6270d05f-b593-4a0d-aa4e-7927fd8b746f","year":2019},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.931190Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:6a85260dca08fa14e2c4a199716409d29412592fff919c66ff155dcbe5eb7389","observation_id":"dd1761c8-0f0a-4f4c-b510-08999a30cd0f","resolution":{"observed_at":"2026-08-06T15:09:52.093189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.069696Z","title":"Moganet: Multi-order gated aggregation network,","venue":null,"work_id":"0670a643-ac3f-40d6-9d1b-fc939baa8db0","year":2023},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.935462Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:02bd52dd13a0fa2e5de81289c4cb1fb172d1ccfa15094476fa4a9c9b31c59ee6","observation_id":"00b3a207-6d1d-4489-ba75-28ba9edb9213","resolution":{"observed_at":"2026-08-06T15:09:52.075347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.049307Z","title":"Imagenet classifica- tion with deep convolutional neural networks,","venue":null,"work_id":"6fbeee06-7497-4b8c-9c92-bd4487fe4205","year":2012},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.939788Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:dd64ae5f7874636e0820f99c44e31cb74aced85fd94f7b3633b67d846d6ce77c","observation_id":"7dbe8029-f3a1-47f1-9d31-cf2c491db886","resolution":{"observed_at":"2026-08-06T15:09:52.055737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.031864Z","title":"Very deep convolutional net- works for large-scale image recognition,","venue":null,"work_id":"45752345-3f32-4113-80d8-94f1b5ba8206","year":2015},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.946472Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:91dea4011bd481425e0fb4aae35e4ca0a4ed4eb9b0cc9b7ae478c5bbe9c0cf69","observation_id":"28ac3b53-c809-4ce7-98dc-a24988dd79de","resolution":{"observed_at":"2026-08-06T15:09:52.037721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:52.014117Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":"01df34be-2b82-44a9-aa69-4b525cc288b5","year":2016},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.952021Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:3a4a29c1cd114ab1f659feb1493eefffd3e5065f8b018e09c474f238e1658539","observation_id":"5d393ba6-29d0-4826-a9ee-cad7b07bbddd","resolution":{"observed_at":"2026-08-06T15:09:52.019935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.995209Z","title":"Densely connected convolutional networks,","venue":null,"work_id":"3263b486-d4da-475f-b466-51e94f4782f3","year":2017},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.957366Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:762907399055aca0b7dd46730b8041afe659bf097af208c7643fd170cf97d705","observation_id":"7f605f21-1755-4124-ba03-41a201580d8f","resolution":{"observed_at":"2026-08-06T15:09:52.001879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.975909Z","title":"Convnext v2: Co-designing and scaling convnets with masked autoencoders,","venue":null,"work_id":"9d354af6-0457-4655-8c9c-0b732cbeb7b1","year":2023},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.962465Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:1233d70e25583be7c586a261f7cacef0558faf78de141dcf5883e033a72dafac","observation_id":"cb93ccad-6b2f-4b64-8608-7220e8cd1d3a","resolution":{"observed_at":"2026-08-06T15:09:51.981255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.957986Z","title":"More convnets in the 2020s: Scaling up kernels beyond 51x51 using sparsity,","venue":null,"work_id":"44032392-554d-4a83-a310-101fec9070b8","year":2023},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.968379Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:cb84aa7e59b584ff2c822092880189534ec2dc3a00483194dd1f78316172c55a","observation_id":"643adcb0-7999-4429-8c78-13328e67386c","resolution":{"observed_at":"2026-08-06T15:09:51.964054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.941725Z","title":"Unireplknet: A universal perception large-kernel convnet for audio, video, point cloud, time-series and image recognition,","venue":null,"work_id":"56036182-17a8-4729-bf9c-16e96e2b9bd5","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.973296Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:70784cb38be2adb78fe65677c48a496a29a5cabe9cb393a45dfbffbc55cff13d","observation_id":"12aa3452-af55-4f98-bf1e-a7190b28c1f8","resolution":{"observed_at":"2026-08-06T15:09:51.946801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.925698Z","title":"Pelk: Parameter- efficient large kernel convnets with peripheral convolution,","venue":null,"work_id":"9050b026-795e-4468-9dc6-546ac4f03b1d","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.978499Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:4518b82c562b532285973c518a1b22d189594d05c9d193845f8bc014ea506f9c","observation_id":"16d376bf-0f05-45a5-94f3-2c84c3228c15","resolution":{"observed_at":"2026-08-06T15:09:51.931226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.909257Z","title":"Hor- net: Efficient high-order spatial interactions with recursive gated convolutions,","venue":null,"work_id":"c2150161-2862-4b3e-ae84-b547bdb986ca","year":2022},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.983267Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:e3a98496fdcb11eff23b27906ad515654ba286d9dd3c609d6f0ae8f8a021a84d","observation_id":"a1529784-b230-4f1e-aebe-9ac2981dff83","resolution":{"observed_at":"2026-08-06T15:09:51.914539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:50.987952Z","title":"Focal modulation networks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.987952Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:b2f9781d0bb1dd47e4380846b1a6c5667279f72862e81ecba832764f443d8934","observation_id":"ec5c3836-9a92-4a90-84b5-99cad8f21673","resolution":{"observed_at":"2026-08-06T15:09:50.987952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.878046Z","title":"Overlock: An overview-first-look-closely-next convnet with context-mixing dynamic kernels,","venue":null,"work_id":"656d4868-abc0-4b47-bea7-5ee5f5bdef5c","year":2025},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.993755Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:7da0335eccb60b42031a97c8cde55d4f468026e3d99d802a9c2135784101a9c1","observation_id":"b19a8034-6077-43f6-b0b2-e0034dd3e4d5","resolution":{"observed_at":"2026-08-06T15:09:51.884669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.858802Z","title":"Neural mech- anisms of visual attention: how top-down feedback highlights relevant locations,","venue":null,"work_id":"1a2612a3-116d-45ae-83d0-53697a6a95d4","year":2007},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:50.998263Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:70aa1b01321323c1f3a814beeff59d0b46f0e4cd5fbb32c9b6c7ac90330fd5de","observation_id":"a9ec3333-e050-4969-9012-0a98f571db77","resolution":{"observed_at":"2026-08-06T15:09:51.865847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.839619Z","title":"Cmt: Convolutional neural networks meet vision transformers,","venue":null,"work_id":"fbf161a8-e8de-422a-89df-348ebb899754","year":2022},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.003026Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:cd8eb7707505771ed8a57dd95b27d34399683df4a23a06fedb260e89a1dcfec3","observation_id":"5128317b-447b-44c9-9275-87a9cb64838a","resolution":{"observed_at":"2026-08-06T15:09:51.846467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.821833Z","title":"On the integration of self-attention and convolution,","venue":null,"work_id":"70d27365-ca8a-4abd-86de-9b857a7431ae","year":2022},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.007882Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:b12ce7da814b90c4bdfae421a9754db69f6b09c9c3b34003ad6410af9cbd68bc","observation_id":"0880391d-1485-4ac4-a046-533ffcf4671f","resolution":{"observed_at":"2026-08-06T15:09:51.827723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.805129Z","title":"Mixformer: Mixing features across windows and dimensions,","venue":null,"work_id":"aacd9a66-81dd-4053-a19f-3f18d920004f","year":2022},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.012553Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:76f5991cd4ee187d5f10ad78e2cc392d8db0f37bb98fc18f87640b6ebd34a250","observation_id":"91fcc3f0-373d-48e3-a882-8720fe7ce769","resolution":{"observed_at":"2026-08-06T15:09:51.810651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.787327Z","title":"Transxnet: Learning both global and local dynamics with a dual dynamic token mixer for visual recognition,","venue":null,"work_id":"3a7f0b57-05d0-4421-8f36-e4aca75b4133","year":2025},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.017183Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:0234de35e4ea08f84f5e4d3d01f1b0af5dda146559b6eda14072de5cf54ee5f5","observation_id":"03545270-c0f6-455b-8846-c95e9f04cca2","resolution":{"observed_at":"2026-08-06T15:09:51.792466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.771307Z","title":"Uniformer: Unifying convolution and self-attention for visual recognition,","venue":null,"work_id":"cd744f9b-197e-410a-bd49-0c71eeefa811","year":2023},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.023961Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:40cbc353afb89afab94df6d69f947a9edf7d6bb37d7830882ffe4c31c7e14237","observation_id":"22569066-d2e4-4aba-8a01-8d3646242ba6","resolution":{"observed_at":"2026-08-06T15:09:51.775741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.754047Z","title":"Scene parsing through ade20k dataset,","venue":null,"work_id":"91cfb2d1-fbe7-4c82-bf1a-385c9ed3f534","year":2017},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.028863Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:38a1f7581d31bcdfbfaaadad978eeb709176c7ca125c5c108f0ee21f7de8bd0e","observation_id":"6f8883ff-dde9-4f66-a727-bb50269aacca","resolution":{"observed_at":"2026-08-06T15:09:51.759881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.737620Z","title":"The cityscapes dataset for semantic urban scene understanding,","venue":null,"work_id":"87346e73-69d6-44af-bc7e-82d3c988e502","year":2016},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.032953Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:6defbdb0211526aba90d28da1158e0026617aec756b1114e6dd6aeb51a89d82d","observation_id":"f86d9b79-7c75-4220-8ecb-4bec17e5f0e2","resolution":{"observed_at":"2026-08-06T15:09:51.742741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.721252Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":"e4581413-8314-41ea-971b-96587cff126a","year":2014},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.038445Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:9df9f196f23f20cbfd6690b5ee829493c214436af9fd08d0d658c40a87754de7","observation_id":"8c82a540-b78c-4408-81cb-d6867040d5cb","resolution":{"observed_at":"2026-08-06T15:09:51.726710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.043283Z","title":"Segnext: Rethinking convolutional attention design for semantic segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.043283Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:23be7b1214001ef3e847a93381ce88ebff50cd03989f307cba8542b4b49ff237","observation_id":"77bbea64-1a7a-4227-b7fc-50e7b8144e1d","resolution":{"observed_at":"2026-08-06T15:09:51.043283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.694650Z","title":"Multi-scale representations by varying window attention for semantic segmentation,","venue":null,"work_id":"7eda3287-72a5-4608-934e-ad1e489cc76c","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.049098Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:c437f6ffcb85627210fef5a9022ed6c9cf03c01330e4e8b9876f7ef8d78fafbb","observation_id":"d9196c39-f9e7-4554-88cf-07431370702b","resolution":{"observed_at":"2026-08-06T15:09:51.699539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.679436Z","title":"A convnet for the 2020s,","venue":null,"work_id":"98e22fbc-35d0-40a7-a864-31b9e72889c0","year":2022},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.053901Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:21ca6b2a9a786dd6d4723e0374b9503391b857b7a5c97ce612c29ecbd19c7e8f","observation_id":"15439f9d-68ef-4eae-94d9-f8291e155b51","resolution":{"observed_at":"2026-08-06T15:09:51.684223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.663612Z","title":"Deeplab: Semantic image segmentation with deep convo- lutional nets, atrous convolution, and fully connected crfs,","venue":null,"work_id":"744cf55d-3b03-4efa-9c13-13927ff44688","year":2017},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.058627Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:8d9ac43ac63824fc36d01fece74ac9d414fb6835483a7a8af6813f8f427f8efa","observation_id":"f0e22b52-5ef7-4558-a626-20735c413c99","resolution":{"observed_at":"2026-08-06T15:09:51.668970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.645983Z","title":"Segformer: Simple and efficient design for semantic segmenta- tion with transformers,","venue":null,"work_id":"2b7de920-ebc3-4755-84f6-87ec392dd4a6","year":2021},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.063492Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:ca24cf291538e2bc1c7fa2ebd3a14ca5a38a6c415ba716c202cb56a22731f52d","observation_id":"b4c18396-b865-458c-957e-6f0116169af8","resolution":{"observed_at":"2026-08-06T15:09:51.651635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.628953Z","title":"Encoder-decoder with atrous separable convolution for semantic image segmentation,","venue":null,"work_id":"ae7a5bcb-a339-4238-8407-2e4708bdf035","year":2018},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.068752Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:2a5883692f2980fcdd8ded871063b3c99124fa58517f2c1b8e04c4db2ed7a2ee","observation_id":"8ede2beb-da45-4abe-9517-98d23d432cee","resolution":{"observed_at":"2026-08-06T15:09:51.635160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.612386Z","title":"Quadmamba: Learning quadtree-based selective scan for visual state space model,","venue":null,"work_id":"326b5a4a-fa67-47fa-9e87-2d63e716495d","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.074871Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:6915eee31f1d38ba33d20b64bcd9864e303034f99e0a2601227e348ba5dff4a7","observation_id":"fd6975bf-1120-470f-b34b-2751e263d2e5","resolution":{"observed_at":"2026-08-06T15:09:51.618075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.595371Z","title":"Inceptionnext: When incep- tion meets convnext,","venue":null,"work_id":"bd344679-718d-44b9-921f-120f0929bab0","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.080509Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:42e47d68333870c7d371fd7485edf80d11746ce0769bcac7457974f9b789ea55","observation_id":"df65a1c4-3f36-40a0-a9d9-0d426726c940","resolution":{"observed_at":"2026-08-06T15:09:51.600605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.579441Z","title":"Multi-scale vmamba: Hierarchy in hierarchy visual state space model,","venue":null,"work_id":"adcdef46-408e-4601-9449-cc2d62f3d6df","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.086640Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:f8af02281bca9581f46ec91eeee2028ce7647593e3706ae1b1638c9ae971bcbe","observation_id":"91ffedd3-ea61-412c-a24e-b180ae6ba3d7","resolution":{"observed_at":"2026-08-06T15:09:51.584071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.561661Z","title":"Densenets reloaded: Paradigm shift beyond resnets and vits,","venue":null,"work_id":"22177612-7f79-4558-b26b-9afb50d508ce","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.091457Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:73b9525fb1e3fc9b0973ff081b21708e7c9e75e34b83a3c5bc0e2aa70ad161b0","observation_id":"1a444a73-e66f-4558-9edc-9db3477f0f6c","resolution":{"observed_at":"2026-08-06T15:09:51.568557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.544910Z","title":"Regionvit: Regional-to-local attention for vision transformers,","venue":null,"work_id":"19481f40-9f7e-46e5-ad60-cb826e1d034c","year":2022},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.096290Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:bfd5b67f8c645bfaa64f7384fc92ba097a924527e5fafac152f1917a2bc65e77","observation_id":"cff5d136-c713-420b-acfd-8457efa018e9","resolution":{"observed_at":"2026-08-06T15:09:51.550163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.528337Z","title":"Mpvit: Multi-path vision transformer for dense prediction,","venue":null,"work_id":"563a5856-489b-4048-afcf-66a6eb6b9712","year":2022},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.100808Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:843fd595ce8cefb112c3add57f9fa7c964983de480931de27b4702e22ea61850","observation_id":"2f4e69f1-b3ae-406d-97c4-aefc8daa60ec","resolution":{"observed_at":"2026-08-06T15:09:51.533753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.512433Z","title":"Conv2former: A simple transformer-style convnet for visual recognition,","venue":null,"work_id":"4afa0fbb-957c-4a89-a6a1-a260ab837dc9","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.105608Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:a29ac75c59cc61c79cb634e1267819037892f7720395ea639652161747d44f48","observation_id":"a87df564-05ff-4907-9655-48194ac3c1dc","resolution":{"observed_at":"2026-08-06T15:09:51.517351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.496668Z","title":"Scale-aware modula- tion meet transformer,","venue":null,"work_id":"253c3dd0-91c5-469a-b81e-4d050bd80fe4","year":2023},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.110436Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:c7a8350639388090dfe0173f34e95a391dc8a653d1d5ac59953bc00dd8f63857","observation_id":"ee731c59-0194-4631-9c26-0dc15ff27d6c","resolution":{"observed_at":"2026-08-06T15:09:51.501947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.481468Z","title":"Internimage: Exploring large-scale vision foun- dation models with deformable convolutions,","venue":null,"work_id":"e7a5703a-65f5-4d7e-ade2-d615aebe6397","year":2023},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.114692Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:d5e789d533af730c9e643f44f004c4961aee706c55c6a07be0adb39cd3b9c97f","observation_id":"df2dcf6a-2ae8-4a98-ada7-cad407c44a59","resolution":{"observed_at":"2026-08-06T15:09:51.486061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.464310Z","title":"Imagenet: A large-scale hierarchical image database,","venue":null,"work_id":"6d26877c-20ff-44b2-8493-c81bee8ad44e","year":2009},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.119942Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:60d493aae0f0ca754dc705c8d6cb7f8a46328b68e75f66952c5380bbdb54c9bd","observation_id":"01cdc303-15fb-46fd-8bcd-fa1ffa637835","resolution":{"observed_at":"2026-08-06T15:09:51.469534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T15:09:51.125439Z","title":"Decoupled weight decay regulariza- tion,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.125439Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:e18c22492306c5ae64922b11579e99b19ccd94b62af34dd360774b0e66f987df","observation_id":"46f210e5-d794-453a-8ebe-babcbc98809e","resolution":{"observed_at":"2026-08-06T15:09:51.125439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.449232Z","title":"Deep networks with stochastic depth,","venue":null,"work_id":"1984ea13-52cc-4930-aa2d-27545d6daf8f","year":2016},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.130573Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:68352c5cc70af0dcaaa7e581321a771c5f9273b58b6cf32ba2642027e1534239","observation_id":"b7ff434e-4060-49aa-b7ad-82623b732131","resolution":{"observed_at":"2026-08-06T15:09:51.453571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.433095Z","title":"Mask r-cnn,","venue":null,"work_id":"9bf04511-3e05-4366-8727-29d92cea3ec3","year":2017},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.135257Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:33d7a13d0c1a51a64f1fdd0517b3d1faa46b66c0920cf1e6d07920c693efc1bd","observation_id":"b5860b4b-f80e-4c06-937c-fcdf935e81c4","resolution":{"observed_at":"2026-08-06T15:09:51.437919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.418677Z","title":"Embedding-free transformer with inference spatial reduction for efficient semantic segmentation,","venue":null,"work_id":"0183096d-82bb-4ecc-ada9-088a921816c1","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.139667Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:5f99cf3703f906ef3950c6ddf4ca69f3d6a628b09d662f885964763fc965f87e","observation_id":"c2f1edf9-e4f1-44d5-97c8-2e0eebb8890a","resolution":{"observed_at":"2026-08-06T15:09:51.423000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.403480Z","title":"Context-guided spatial feature reconstruction for efficient semantic segmentation,","venue":null,"work_id":"3e5d20d0-fa08-4dbd-b962-697c7e5d977c","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.144490Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:874063fd0204a5a016787b41ffb7f06a8a783dc37133e40dce5244ec89990386","observation_id":"a773eba3-3765-45f9-9fb1-3918a217b3dc","resolution":{"observed_at":"2026-08-06T15:09:51.408059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.385670Z","title":"Vit-comer: Vision transformer with convolutional multi-scale feature interaction for dense predictions,","venue":null,"work_id":"4851a45d-003a-4407-919c-c40b7babb8ee","year":2024},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.148784Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:4bbd41923f102a1294778ef4ac4bbfad54a85c9ce95de287eaa183a33dec0d4b","observation_id":"f50bed9d-a8f6-48ac-aa4d-03d8ff13f6bb","resolution":{"observed_at":"2026-08-06T15:09:51.391151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.368564Z","title":"Object-contextual representations for semantic segmentation,","venue":null,"work_id":"13f11b75-ceec-4757-a37c-72b5ce3eb844","year":2020},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.152775Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:db3cfe8f1609c317a204e9a55aae157f26cc34a2896c3e14626338064e187676","observation_id":"f2f1046e-3227-4edd-971d-a508d6c615a4","resolution":{"observed_at":"2026-08-06T15:09:51.374085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.348923Z","title":"Per-pixel classification is not all you need for semantic segmentation,","venue":null,"work_id":"89bf7f34-aa9b-4e1e-8e74-056a7e59390a","year":2021},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.157382Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:272507a12cd57776c5a28b1d6b9c15fb5ec39519f5a96934ec0e3b15a8b48023","observation_id":"a9f4f958-a50d-4d1d-8478-724084523eb3","resolution":{"observed_at":"2026-08-06T15:09:51.354809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.329690Z","title":"Masked-attention mask transformer for universal image segmen- tation,","venue":null,"work_id":"75161e5e-1612-4348-8e91-866010fa02dc","year":2022},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.161766Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:ddb4753e2fcd1f1a62c4e9273bc9864ac7d385b14837c68084d12acd03478afc","observation_id":"b7fce7ff-c498-4fad-8179-26fae062073f","resolution":{"observed_at":"2026-08-06T15:09:51.335264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.308924Z","title":"Feedformer: Revisit- ing transformer decoder for efficient semantic segmentation,","venue":null,"work_id":"401c35d8-e961-4cbb-82d4-63c72bf3a42e","year":2023},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.166857Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:9c524ffb67fe5635200ea664b3f8b75f72a98cfba3eb052c8745c769db671b0b","observation_id":"9ef877b5-f265-4913-af54-a63d0a1f6db3","resolution":{"observed_at":"2026-08-06T15:09:51.314652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.290648Z","title":"Low-resolution self-attention for semantic segmentation,","venue":null,"work_id":"1117a5a5-c30a-46e3-8902-661613144649","year":2025},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.171430Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:55df6f6b4c2d6ddf027a4b00fa8422bc9f1420afbae228710c59deaf71abe6fe","observation_id":"81f1c021-34b0-4468-925f-b4a2420c8612","resolution":{"observed_at":"2026-08-06T15:09:51.296202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.273719Z","title":"Understanding the effective receptive field in deep convolutional neural networks,","venue":null,"work_id":"27a7f714-99cf-4c37-8dde-c0165a145043","year":2016},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.175719Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:53a4d48700216609ddbdadd56dbd2a5183aa74df9ccc769592aec3b5701b7179","observation_id":"adba4fd6-f889-4c54-afb7-0d5615bf66d0","resolution":{"observed_at":"2026-08-06T15:09:51.278942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:09:51.253338Z","title":"Deformable convnets v2: More deformable, better results,","venue":null,"work_id":"51270faa-7cf8-4b9a-9b38-f71648dbe2ad","year":2019},"citing_paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T15:09:51.180396Z"},"links":{"citing_paper":"/paper/2507.16624"},"observation_digest":"sha256:8f9fa44095d7bfb053905f2d5ac22934b0d4240e6a6a2c37a7e8bcbac98df574","observation_id":"412d77b3-d95a-4612-b64c-f1e21ae723f6","resolution":{"observed_at":"2026-08-06T15:09:51.261083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.16624","last_updated":"2025-07-22T14:17:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T20:58:25.697711Z","submitted_at":"2025-07-22T14:17:08Z","title":"A2Mamba: Attention-augmented State Space Models for Visual Recognition"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":74},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 0 inbound Pith citation observations for arXiv:2507.16624."}