{"as_of":"2026-08-05T20:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:41d65e398ee27309e2601387c6b58983aa0fd0ff7b247ba94e29116e04e59ed2","coverage":[{"denominator":182,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T19:23:08.100056Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.00746/citation-record","integrity":"/paper/2606.00746/integrity","json":"/paper/2606.00746/citation-record.json","paper":"/paper/2606.00746"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.09417","last_updated":"2024-11-14T02:00:33Z","snapshot_observed_at":"2026-07-06T17:16:59.193820Z","submitted_at":"2024-01-17T18:56:18Z","title":"Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model","version":3},"cited_work":{"arxiv_id":"2401.09417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.09417","snapshot_observed_at":"2026-07-04T19:30:07.531920Z","title":"Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model","venue":"cs.CV","work_id":"bd81352e-a64f-4720-9f76-ddda0ea9af83","year":2024},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"cited_paper":"/paper/2401.09417","citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:84c3379cfabe4909d6837c5a7fe199721000dd7f059a0c68c4755aac04b3a478","observation_id":"e4b188c5-09e5-429c-8371-2a6746ad4450","resolution":{"observed_at":"2026-06-28T19:32:35.279215Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":"2312.00752","doi":"10.48550/arxiv.2312.00752","metadata_source":"pith","pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","venue":"cs.LG","work_id":"4ee75248-1199-492c-a52f-6661e0f4adff","year":2023},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:3623c362f94b3f0214fbf97da610133ce8f6bde1a516fe14efed7d687cd4e289","observation_id":"b4d011d1-a7ba-4a29-b7b1-40c79b015e96","resolution":{"observed_at":"2026-06-28T19:32:35.263227Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-30T19:25:31.081761+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-30T19:25:31.081761+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10166","last_updated":"2024-12-29T14:57:13Z","snapshot_observed_at":"2026-07-06T17:17:31.008185Z","submitted_at":"2024-01-18T17:55:39Z","title":"VMamba: Visual State Space Model","version":4},"cited_work":{"arxiv_id":"2401.10166","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.10166","snapshot_observed_at":"2026-07-04T09:49:44.618504Z","title":"VMamba: Visual State Space Model","venue":"cs.CV","work_id":"ed658421-9e61-4b1b-b2c5-a1376e9f4b34","year":2024},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"cited_paper":"/paper/2401.10166","citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:82b60c0198619670fcc57101de3454ad9cead6b701644c40a4b31d8f1ce340a1","observation_id":"888d9522-7cba-4a30-87f8-102e12af1643","resolution":{"observed_at":"2026-06-28T19:32:35.260657Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09338","last_updated":"2024-03-14T12:32:40Z","snapshot_observed_at":"2026-08-04T23:45:17.190054Z","submitted_at":"2024-03-14T12:32:40Z","title":"LocalMamba: Visual State Space Model with Windowed Selective Scan","version":1},"cited_work":{"arxiv_id":"2403.09338","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.09338","snapshot_observed_at":"2026-07-04T09:49:44.642508Z","title":"Localmamba: Visual state space model with windowed selective scan","venue":null,"work_id":"94683747-a2e4-472b-961e-58dce78493a1","year":2024},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"cited_paper":"/paper/2403.09338","citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:806d486dbc089af153bd9dbc5ebf1c28770396e9237da6f27b4d64a4dbbe83ae","observation_id":"5dba8a17-4535-4c7f-8b2a-5b13cc47ab47","resolution":{"observed_at":"2026-06-28T19:32:35.297416Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10935","last_updated":"2024-03-16T14:23:17Z","snapshot_observed_at":"2026-07-06T17:45:43.726336Z","submitted_at":"2024-03-16T14:23:17Z","title":"Understanding Robustness of Visual State Space Models for Image Classification","version":1},"cited_work":{"arxiv_id":"2403.10935","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.10935","snapshot_observed_at":"2026-06-28T19:32:35.275033Z","title":"arXiv preprint arXiv:2403.10935 , year=","venue":null,"work_id":"79223363-1379-4695-a2a3-33d6f35b7d80","year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"cited_paper":"/paper/2403.10935","citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:ca4f35018b3d75d37d31f76e9c11c0fdf7dd45dc336ca82628f9c8c4294cd284","observation_id":"45583f00-39d9-4f43-9eba-06ad05ccc93c","resolution":{"observed_at":"2026-06-28T19:32:35.276576Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01430","last_updated":"2023-09-04T08:26:47Z","snapshot_observed_at":"2026-08-02T15:35:11.118369Z","submitted_at":"2023-09-04T08:26:47Z","title":"DAT++: Spatially Dynamic Vision Transformer with Deformable Attention","version":1},"cited_work":{"arxiv_id":"2309.01430","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.01430","snapshot_observed_at":"2026-06-28T19:32:35.306796Z","title":"Dat++: Spatially dynamic vision transformer with deformable attention.arXiv preprint arXiv:2309.01430","venue":null,"work_id":"0f308f9c-8f2e-4bbe-b443-e6f723a6883b","year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"cited_paper":"/paper/2309.01430","citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:60bdc2413be13747ae12abad5a33072618c0d6f7b24931e672a4475ae368ecbc","observation_id":"5dba864d-40c4-4e1d-bdb0-a09366f264cb","resolution":{"observed_at":"2026-06-28T19:32:35.308210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"CVPR , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:484023b0e067b19c658fbe966ec4161de2fcdbcb6ad125db17445150c12a685c","observation_id":"ba4d62de-9062-46cf-aaa1-05d554342640","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09283","last_updated":"2024-03-14T08:28:13Z","snapshot_observed_at":"2026-07-06T15:55:21.408850Z","submitted_at":"2023-07-18T14:24:33Z","title":"RepViT: Revisiting Mobile CNN From ViT Perspective","version":8},"cited_work":{"arxiv_id":"2307.09283","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.09283","snapshot_observed_at":"2026-06-28T19:32:35.280371Z","title":"arXiv preprint arXiv:2307.09283 (2023)","venue":null,"work_id":"f6065c05-c51c-43d3-94ab-57ca69fa99e0","year":2023},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"cited_paper":"/paper/2307.09283","citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:321cd99ae22b38d8d78e636edc8896cea90b24499979b6fb09a534224a28e704","observation_id":"43b30545-5901-48e3-b3dc-6e576e27104b","resolution":{"observed_at":"2026-06-28T19:32:35.281790Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09977","last_updated":"2024-03-15T02:48:47Z","snapshot_observed_at":"2026-08-05T03:03:56.500539Z","submitted_at":"2024-03-15T02:48:47Z","title":"EfficientVMamba: Atrous Selective Scan for Light Weight Visual Mamba","version":1},"cited_work":{"arxiv_id":"2403.09977","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.09977","snapshot_observed_at":"2026-07-01T14:25:47.190043Z","title":"Efficientvmamba: Atrous selective scan for light weight visual mamba","venue":null,"work_id":"a63d64b4-cdbf-44f4-a8e0-cc954d67737e","year":2024},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"cited_paper":"/paper/2403.09977","citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:cc581953bc061a064df8dadd8a467e269dd6fb1ace66d6cf5b4cc9709c92a857","observation_id":"d24f9ed9-27fc-4a6b-9ab4-f1c0503cc70b","resolution":{"observed_at":"2026-06-28T19:32:35.299964Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"ICML , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:202ac642cde9d3e83424e6a201b22bcefb787d5631b7161db88ed7b6964ef8c9","observation_id":"40ae98a0-3177-4651-b05b-b6af5617ab17","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:b1c06e7255d8d090e41ca1e171dced8dfdf4c2d0336a1452849d1ce74b18f542","observation_id":"300942f0-8e60-4b9e-9220-df8ca3f950fb","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:3c8906efe16fffb36bfe76564e97dd327d0c94d3f210bf83d99b1c98433b5c5b","observation_id":"b4fbe354-483c-4353-838a-797d131925bb","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"NeurIPS , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:8178686ab7182260498e07482f3eb201cd61daf1352c09162d59b3ed1666f847","observation_id":"d30290c1-0067-4987-909e-4f5d463323ce","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-07-06T03:53:32.549552Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":"1409.1556","doi":"10.48550/arxiv.1409.1556","metadata_source":"pith","pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","venue":"cs.CV","work_id":"1c4b4409-c14b-488b-a086-c57a5aab8a29","year":2014},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:b39d609378c53f5f3a29e40af4c5ddc23ce8aade9a8a3ef5167eb4020111723d","observation_id":"c2925a96-6516-4e55-b547-cddd5fcd01fd","resolution":{"observed_at":"2026-06-28T19:32:35.284479Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T23:51:07.915518+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T23:51:07.915518+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:97553a481077358235e8da08d2b04e33cd0660f5c655aedf09fefe59557a199a","observation_id":"0e17c982-75c7-4e8f-81f9-9109c71b2eb5","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:26653b2df98ba76f75e9ffd35eeb127f0b28c05c964e29f7957615dabc90ffb1","observation_id":"52ae0eab-ea18-4958-8a6e-434215f9d483","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:3a0ff62474616be86fc6ceda81ed0ccd2f99c7045621b0a4ff41a3fdab69f67f","observation_id":"3d27b3dc-2ce3-4203-ab48-be9785ff7a8c","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"CVPR , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:09d41712a92201c3da176beda6e89ba9aef5b87f57e8b69384f5b9c85cd30c52","observation_id":"2b2d09a3-9f8d-4683-ab67-8ebc972fe9ac","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"ECCV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:08bdb034e4cf08093e4e0f594dd8e1ab133436ff8f5a88606f634eb345e4fd8e","observation_id":"835e3033-de84-4acd-802c-e72175b8ff28","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"Computational Visual Media , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:dc0500be3bb8b275481c2927673a740089dc8f85c89b4c276b40063a27640884","observation_id":"5f4c3784-9ee8-4700-8f04-5fbd707f0210","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"NeurIPS , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:fd00ae32c46fc7c8b6c35985467eae104065650538a35259cc05c4cce2c7e0d7","observation_id":"935bb5ca-85d3-4254-91ba-6369a822f059","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:d6bf56d4738bf0823ae30c7dfeee008a666af59a2206f4cbdbcc8ecc893a92bb","observation_id":"90a49eea-1d81-4e70-a93a-147b74283d38","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:992c84dcd95791746992da2b528821d2b3296b9536e79b07991b898f92a00c73","observation_id":"c244fcb3-b250-45bd-a86b-88cc8c785756","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"ECCV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:3dc09f77cc80642d729265a08d04ad99cfe50767e729e3b0b3838aa8743f2eb4","observation_id":"d9eb9fd4-2d68-441f-888d-875ccd5d4365","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"ICLR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:2198024db834aed2f1e317a76aefc1a13af48ee85ca8872cc573f74c2f48f6cb","observation_id":"082ec11b-6b95-4633-b883-3f639f964c26","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":"1607.06450","doi":"10.1007/978-3-319-32025-0","metadata_source":"pith","pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Layer Normalization","venue":"stat.ML","work_id":"20a2d720-0046-4c7c-bcd6-327ec8143f69","year":2016},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:6d75b844ada2cad27d31da2a656cd472df551e439dd9cc43a99eb8acd55c7291","observation_id":"4650d050-7f97-49cb-8684-a7df64c79473","resolution":{"observed_at":"2026-06-28T19:32:35.292139Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"ICCV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:6e635beb1bb3a758a1a23e33ff115a13254fdb590d81b84b60996dbc740c5783","observation_id":"de2e43bf-dc4b-4fa4-b36e-6ba7a57f400f","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:437409514b5bb61cd68c3f4b33494aa30e8fe81c50efabc13913dd99036bd01b","observation_id":"f29001cc-2afa-455e-934f-04043bf731ef","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"NeurIPS , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:6cfc62c37f5f50dfe9746b9864f80482c15865b043877b4346a8d2155b1ec4fe","observation_id":"fb6725ad-5a20-456a-9ed6-6942eca1d4bd","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05778","last_updated":"2023-04-17T11:51:12Z","snapshot_observed_at":"2026-07-06T14:16:52.598523Z","submitted_at":"2022-11-10T18:59:04Z","title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","version":4},"cited_work":{"arxiv_id":"2211.05778","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.05778","snapshot_observed_at":"2026-06-28T19:32:35.285668Z","title":"Internim- age: Exploring large-scale vision foundation mod- els with deformable convolutions","venue":null,"work_id":"f6269124-1471-45b6-863b-d94f58db1a6b","year":2022},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"cited_paper":"/paper/2211.05778","citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:49e4c5bee01fc45567a41f46c3fd23233e636e57840f2c8fc5b1c62e90e29092","observation_id":"374b012a-5cf0-47f4-8869-cc7684176c1d","resolution":{"observed_at":"2026-06-28T19:32:35.287136Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17695","last_updated":"2024-08-15T14:30:02Z","snapshot_observed_at":"2026-07-06T17:51:02.529047Z","submitted_at":"2024-03-26T13:35:10Z","title":"PlainMamba: Improving Non-Hierarchical Mamba in Visual Recognition","version":2},"cited_work":{"arxiv_id":"2403.17695","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17695","snapshot_observed_at":"2026-07-04T12:59:52.167782Z","title":"Plainmamba: Improving non- hierarchical mamba in visual recognition","venue":null,"work_id":"8ab0db89-a5aa-43ac-8f80-944d0b0d5bc3","year":2024},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"cited_paper":"/paper/2403.17695","citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:802f4279cda06f977d14278176b70f4f454b6efcc64a5f7ecd14524a7ed35acc","observation_id":"3548c9a8-4a88-48aa-8272-43797c5f2c59","resolution":{"observed_at":"2026-06-28T19:32:35.268642Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"NeurIPS , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:1e370bec009946f31fb2a4fea8709372ace4f78e7e71ceacaa4232a7ac4a0368","observation_id":"71d2a1b3-7717-442c-aa74-db3b007138fc","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07992","last_updated":"2024-05-20T16:36:21Z","snapshot_observed_at":"2026-07-06T18:13:42.288757Z","submitted_at":"2024-05-13T17:59:56Z","title":"MambaOut: Do We Really Need Mamba for Vision?","version":3},"cited_work":{"arxiv_id":"2405.07992","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.07992","snapshot_observed_at":"2026-06-28T19:32:35.269755Z","title":"Mambaout: Do we really need mamba for vision?","venue":null,"work_id":"cbf63d57-510f-4f66-aad8-aa9c21b685fd","year":2024},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"cited_paper":"/paper/2405.07992","citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:70d66f790343daba3d45c4f5ecd7a293f54f90af1bb3790aa8d0415b8e0b7f28","observation_id":"ed0cc818-8fa0-4035-8176-2325a940742c","resolution":{"observed_at":"2026-06-28T19:32:35.271250Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14174","last_updated":"2024-05-23T04:59:49Z","snapshot_observed_at":"2026-07-06T18:18:21.334080Z","submitted_at":"2024-05-23T04:59:49Z","title":"Multi-Scale VMamba: Hierarchy in Hierarchy Visual State Space Model","version":1},"cited_work":{"arxiv_id":"2405.14174","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.14174","snapshot_observed_at":"2026-07-03T20:38:55.697199Z","title":"Multi-scale vmamba: Hierarchy in hierarchy visual state space model","venue":null,"work_id":"02c50a1e-c3be-4ad7-8634-e59ef30a47d5","year":2024},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"cited_paper":"/paper/2405.14174","citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:d6fcd32b2a45187fd7fa3e9faef11f3011ebc9a72589623a7015c4b0ed30e276","observation_id":"68958883-4721-45a6-9786-155667022fa0","resolution":{"observed_at":"2026-06-28T19:32:35.311195Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08791","last_updated":"2022-02-17T17:53:48Z","snapshot_observed_at":"2026-07-06T12:38:52.417555Z","submitted_at":"2022-02-17T17:53:48Z","title":"cosFormer: Rethinking Softmax in Attention","version":1},"cited_work":{"arxiv_id":"2202.08791","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.08791","snapshot_observed_at":"2026-07-09T01:45:50.805747Z","title":"Zihan Qiu, Zekun Wang, Bo Zheng, Zeyu Huang, Kaiyue Wen, Songlin Yang, Rui Men, Le Yu, Fei Huang, Suozhi Huang, Dayiheng Liu, Jingren Zhou, and Junyang Lin","venue":"cs.CL","work_id":"35328ee6-119e-48c6-98c1-7fa38bc5f20a","year":2022},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"cited_paper":"/paper/2202.08791","citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:8c1286450427b0188f6a646dca378f740de4adac9d254bfc83ed7c60480f5612","observation_id":"70868a02-ccef-4368-b097-4fda070509ac","resolution":{"observed_at":"2026-06-28T19:32:35.302922Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.07155","last_updated":"2019-06-17T17:58:12Z","snapshot_observed_at":"2026-08-03T13:01:27.142233Z","submitted_at":"2019-06-17T17:58:12Z","title":"MMDetection: Open MMLab Detection Toolbox and Benchmark","version":1},"cited_work":{"arxiv_id":"1906.07155","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.07155","snapshot_observed_at":"2026-07-10T10:27:02.355587Z","title":"MMDetection: Open MMLab Detection Toolbox and Benchmark","venue":"cs.CV","work_id":"88b51c19-cd39-43c5-89fe-5c199a74250d","year":2019},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"cited_paper":"/paper/1906.07155","citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:6c4b779a489a7d7693290b16a6cdd868b324bb387d3c71f1055bfc3c77fdf99b","observation_id":"93eacc54-4d0b-4985-b686-5ac6542ee0ad","resolution":{"observed_at":"2026-06-28T19:32:35.273774Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:f7f8124c9a99014f8f65836cb0801a190db80160ab83ce0f2afaa83412a5fc96","observation_id":"b126738a-5202-4ecd-afcf-e96f5a9d7349","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"ECCV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:eb18632fe05fd51a8e7e1e42709ffee05c9661024abfe979484c3c832d758422","observation_id":"42f70386-c984-4c3b-9966-252e65892a67","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"WACV , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:04b9d2a41cf56d6273fad6c46b3131a90c2a6bfd1a5f763aceab8a666ff6c5d6","observation_id":"aebcabb0-97d7-4709-9921-996e36a7077f","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:182df580f19ecdc408165cc3faa31ce4fac47ee4d209293163e6b4df23dbfcce","observation_id":"17b70152-6aef-41eb-97b4-bbd621650237","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03605","last_updated":"2022-07-11T10:30:29Z","snapshot_observed_at":"2026-08-04T22:53:41.491205Z","submitted_at":"2022-03-07T18:55:26Z","title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":"2203.03605","doi":"10.48550/arxiv.2203.03605","metadata_source":"pith","pith_arxiv_id":"2203.03605","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","venue":"cs.CV","work_id":"4e842f69-fa99-4dde-b8a7-b5a558d4c80b","year":2022},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"cited_paper":"/paper/2203.03605","citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:843ab173d31418d2f0e3cd24a4c02b48b4dd10f286e972d68aa9f1029574d422","observation_id":"17201662-0422-4c37-a156-d9e68d3f3b33","resolution":{"observed_at":"2026-06-28T19:32:35.265687Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:89ec9ce664de04dd942606eb470fb0b5c48f252f8edadebe83a8aab8f785886e","observation_id":"ef04d28f-25ba-480f-858e-377fed441a6e","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:41d706e0890b5909cb5798657708fba8c0c315179f6bfe54543f2aa12ab0b845","observation_id":"ffabd472-8a7d-4c2f-812a-093ae59bd82a","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:f71310c3a72a445708f164e72599b0c6d70bfc407009efde2d7c1debc44d39b4","observation_id":"dba2d969-7de9-48e2-8546-eb5999ecf15a","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"and Feng, Jiashi and Yan, Shuicheng , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:db4567996bb42f44d9bb46b1a9ef81d2980eaa6a050b5c2d68d1693dc21a421a","observation_id":"6c0074bb-8ea8-462f-9f0e-2978cf7af824","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"CVPR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:6b13a6691a740537fe9e120b843f1feb71c98a4d8bfc6baed195958d463844ed","observation_id":"a3f6a163-b95c-4d36-be82-64c826c484df","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"2024 , journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:0c6e029de6aadb234d932ef483a78144294d7eb33b6c1fe0d887a1fd26f8faeb","observation_id":"f39e1696-b515-4c4a-98bf-a1a62ae49edf","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"2024 , journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:f3bc348b2f43d48d3b3ef400f695d01cc6ea8f012ee72cc9619f3ea1624ad8b2","observation_id":"de34549c-7e59-43dc-ac8e-24150d688ea3","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"2024 , journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:e3c8af40b519645cedae077d6625b600861ab4eb86e451d3f49b6ce863aa2d07","observation_id":"87c96125-8ae2-44e5-b8a7-5e9608de4bff","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:f2da7ee77fa525c39709eb550705e2dbf8468aec6bbc7a46e4f75e573ab3f6b7","observation_id":"35625092-286b-4f70-91f7-5caea85557dd","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"2024 , journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:cec529a51e8c7b4a3351b9a2db708c6349681c152c734491b69642af0121feb5","observation_id":"27d67e74-ae40-483b-a437-4a17a93145e2","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05892","last_updated":"2024-07-13T17:37:00Z","snapshot_observed_at":"2026-07-06T17:27:37.212340Z","submitted_at":"2024-02-08T18:30:50Z","title":"Mamba-ND: Selective State Space Modeling for Multi-Dimensional Data","version":5},"cited_work":{"arxiv_id":"2402.05892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.05892","snapshot_observed_at":"2026-07-01T14:25:47.217613Z","title":"Mamba- nd: Selective state space modeling for multi-dimensional data","venue":null,"work_id":"ac58338e-73a5-4ed9-aa7e-dd442ad0c836","year":2024},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"cited_paper":"/paper/2402.05892","citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:a6f1921ec1ec3801f63991bda6e9d3db43b90092c73765ca4320fc64f288b688","observation_id":"8289bc1e-7087-4bb8-83ae-0ad241b159e0","resolution":{"observed_at":"2026-06-28T19:32:35.289726Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:2380ca3fd693b860a634586388726b08c5ce42742057435d4efffb670a3c8b15","observation_id":"8e54701d-9ded-4bcb-bed1-3a24f1271c86","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05501","last_updated":"2022-08-16T10:16:20Z","snapshot_observed_at":"2026-07-06T13:30:21.406367Z","submitted_at":"2022-07-12T12:50:34Z","title":"Next-ViT: Next Generation Vision Transformer for Efficient Deployment in Realistic Industrial Scenarios","version":4},"cited_work":{"arxiv_id":"2207.05501","doi":"10.48550/arxiv.2207.05501","metadata_source":"arxiv_reference","pith_arxiv_id":"2207.05501","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Next-vit: Next generation vision transformer for efficient deployment in realistic industrial scenarios","venue":"arXiv (Cornell University)","work_id":"fdd8329b-acdb-4d0d-8064-e369f9a4314d","year":2022},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"cited_paper":"/paper/2207.05501","citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:5db09f6ba98e97dcc98f37df4aae236b73413496e001852975a8743af5bcc7c8","observation_id":"2c0f9cbf-c362-4b18-a234-caeb4dc91e84","resolution":{"observed_at":"2026-06-28T19:32:35.294812Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:37.672278+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:37.672278+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:ef89532f4b05a685893e93a82df51b21e00ed858492168ed7a0115ed1a9622c7","observation_id":"7b440d95-3035-49fb-9f90-3164a7080b54","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:9aa1d7d6a4de193bc3032c1ff9297ba846047a9ae213efeaf4ede29adbe6cc99","observation_id":"28ab6607-0886-4290-b90f-81c9e052d87c","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:49a3ead4e4e7c1c38bf8685d2fde8823ab1be31f816576194022b034cc991eb5","observation_id":"25af2553-0d47-45bc-ba18-4fb93a4b2dd1","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:add3aaa312846a87204020802c2579ea2168a16a0f32b6970ed493c847a4fc7f","observation_id":"50d0114e-4b49-4c7a-bc3e-df4367295174","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:f864abecd29ee6cd8d6a5142d825f5a32b0a648b34cd70b62dbe8d68f5e6872e","observation_id":"a092b124-546a-452c-96ef-39600868fe35","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":"1904.10509","doi":"10.48550/arxiv.1904.10509","metadata_source":"pith","pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generating Long Sequences with Sparse Transformers","venue":"cs.LG","work_id":"c5b81688-45ee-4a9a-b095-e6290f45cb6c","year":2019},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:19d3c9b85873571019276600fa3ee0e82607a31523502ba1d4a68c423b0b7520","observation_id":"bb1e4fa8-323b-4738-9464-6c22b22df1d1","resolution":{"observed_at":"2026-06-28T19:32:35.305623Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:ff1f16f1b668b0e9cb0e81e30d8dd4f5d5f91edf8807a7f388ded672ffe733e9","observation_id":"4c6e72d7-382e-41de-8dd1-d6ea9b684ec3","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:cabf96951ac2fcb8bac257da5a57270684859a001f1a6caf8dd7176ddcd50c50","observation_id":"ca81ba48-8964-44cd-bff2-ad8313931b65","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:9ee0e248a3aa4c0acdd62d7227e0b2002e36c9bae2f7d51d4734d3a327c6b7f5","observation_id":"464ead9d-8216-41f2-977b-93e4d6626045","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:537fc0f5b88186399ea63918e993149990cef14b45040471d6b09b18d91e5140","observation_id":"a3c4f514-cd98-49fe-aff4-ce4ecf895ed7","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:007972e49e9bebc813f7a64bd1d77956010fd183cca917c3d2770c1ebd5413bf","observation_id":"bb4a0908-68c6-41a3-a8da-1a6e3bc2a06c","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:3befd1cd2c4701968e30edd88fb2fd918a68c5d36c6b6facac227ae1f3ae0dfc","observation_id":"7f76922e-36a2-46fe-b215-9e14cc781c8f","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:1c33be2a8003e5b21fa2f2fa1f9f8b19055a3090510d5ec6b614d4002f6e765f","observation_id":"5521705a-b75b-4804-8ae9-88845100713d","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":"2006.04768","doi":"10.48550/arxiv.2006.04768","metadata_source":"pith","pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Linformer: Self-Attention with Linear Complexity","venue":"cs.LG","work_id":"4b717b51-6098-45d0-8e9e-b69bef651bc3","year":2020},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:10da806c9e08d251169c2cfb4b89e9c25796e4c8d31140f18c53e1f8d596a47b","observation_id":"a176950d-2cc1-483c-ba04-561fde4cf394","resolution":{"observed_at":"2026-06-28T19:32:35.204429Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:0803fc69dea11fef06de5db24295bcfb32639bc153ee8edabe339f6b20727e23","observation_id":"0f6a2a58-5f54-4a32-a56f-b580e732c8dd","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:6bb5cc1ac1c9c27be63069f413dbc677089c36a36528f04b163d5637c95d08f5","observation_id":"d68b5971-8595-49a9-beca-35dc6e601772","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"Neurocomputing , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:68a49820876016267f442c27ec0249806289f56804bd26144b0b16c57965ec0f","observation_id":"22f79374-f787-4c6e-a2b8-8aea3df1a721","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02077","last_updated":"2023-11-03T17:59:55Z","snapshot_observed_at":"2026-08-03T23:31:39.294900Z","submitted_at":"2023-11-03T17:59:55Z","title":"EmerNeRF: Emergent Spatial-Temporal Scene Decomposition via Self-Supervision","version":1},"cited_work":{"arxiv_id":"2311.02077","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.02077","snapshot_observed_at":"2026-07-08T03:24:28.762183Z","title":"Emernerf: Emergent spatial-temporal scene decomposition via self-supervision","venue":"cs.CV","work_id":"a7c91f0a-e32a-47fd-ab9b-aec98b92c370","year":2023},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"cited_paper":"/paper/2311.02077","citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:6a68a8b7f3658f5df5fc060d609f9449c6f78f852c755512b71a3b1f5f9490b1","observation_id":"bf71b658-ccbd-4693-947e-ef9d79170588","resolution":{"observed_at":"2026-06-28T19:32:35.236523Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:86d23791ca437d77f2ffc1e0f701d5f7dfc2dd3f03c48fe05644e6ecedb892ec","observation_id":"a20da377-a776-4ee3-82ab-f7c88743fbfd","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:d86fdd658c92bc778639e344372648c22604d3998b5b9a3d87e62e3a663cb678","observation_id":"c1c4718e-97ad-4e51-b965-57651116589d","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.11096","last_updated":"2019-02-25T21:32:06Z","snapshot_observed_at":"2026-07-06T07:04:57.275371Z","submitted_at":"2018-09-28T15:38:49Z","title":"Large Scale GAN Training for High Fidelity Natural Image Synthesis","version":2},"cited_work":{"arxiv_id":"1809.11096","doi":"10.48550/arxiv.1809.11096","metadata_source":"pith","pith_arxiv_id":"1809.11096","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Scale GAN Training for High Fidelity Natural Image Synthesis","venue":"cs.LG","work_id":"244e6f06-bad2-4f34-8186-ff370286427f","year":2018},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"cited_paper":"/paper/1809.11096","citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:0397d39d896dfdfb659c135cbe83e51ba46203840fc956e983567195da31bf12","observation_id":"9f5c0bac-b784-4d77-a56c-938367a30acf","resolution":{"observed_at":"2026-06-28T19:32:35.207389Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-02T12:08:12.712369+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T12:08:12.712369+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"ACM SIGGRAPH 2022 conference proceedings , year=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:19dbfa450d2049664f2b865425ac00b5b67f73cddae2151be28244b6c31f3aec","observation_id":"89d8c85e-7f53-494e-aef4-5df02432faa6","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"Advances in neural information processing systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:58c65e1c7150a13aa9f94c65a28b2c77867e931825bf618306a8a95cdef69fa9","observation_id":"4248b66c-3883-4174-9e5c-72f50aa71177","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:bb11c86809e11fa1d310e5413c6c167b286a2d29605207bc60d525d8a5e2dad5","observation_id":"629253f5-6f75-448f-9dd8-743591747d4d","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"Thirty-seventh Conference on Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:cef0ee2a26a04287c6d0ef4cd29ff61196f220c6f64f2ba4d2464140353ff007","observation_id":"7cb0aaf4-0146-4d95-904a-037bd07127a8","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:8cda0b3f6fb3d74763802dfe7aefac0579292ce43cb088beb8abbdbed1b36a58","observation_id":"18c79bc6-fd01-41e1-ba39-3f9ee4376531","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:f8acaf1ad36dd892795311a0f412d83baebb6aecb75920b893015b7daeeda889","observation_id":"69c2d5d5-5111-443f-8616-44b61d1ce32a","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:aaa200246bffe13ef489d0a6a4818de012abb5275f0ea31f18597d85a2d92731","observation_id":"2f0d0ee5-3b6c-4f73-afb2-d60266e5c664","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:18e53ad761ad4d090c976880e1f9d1e372179286902dcb0a552f64f278f51d1b","observation_id":"f3830a27-a2aa-42f5-83f0-dc27eb208764","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:f53f87356f4253c6b133cdb0db9ea2840f42d6b05dc510ed27f904c432899877","observation_id":"91f17848-bc7b-4678-bb7e-f67ede76d2c6","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:479b4c11bd3221ed72f520355dab23bb3965f88250b8f984ccf0f8ff32158b02","observation_id":"f50d8dd8-734f-4642-9c44-11998971d5ab","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03841","last_updated":"2021-03-05T17:56:03Z","snapshot_observed_at":"2026-07-06T10:47:19.371360Z","submitted_at":"2021-03-05T17:56:03Z","title":"Generating Images with Sparse Representations","version":1},"cited_work":{"arxiv_id":"2103.03841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.03841","snapshot_observed_at":"2026-07-03T22:18:59.593848Z","title":"Generating images with sparse representations","venue":null,"work_id":"ef629e22-0b1b-4ba3-b749-9ea9efc087f6","year":2021},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"cited_paper":"/paper/2103.03841","citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:d23fffabe4c27a5358c173d17b7d5301dd24eb77525aa52a71dbefbb0c85ac22","observation_id":"89947199-e67e-4188-8e02-628b3c471891","resolution":{"observed_at":"2026-06-28T19:32:35.215164Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:21bb2d4e19346dc7a5e329b34226e859cbdf27ec93d716fa68950610db4ae203","observation_id":"54ef86a3-a324-4c51-aaab-2eb983f80a76","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:84b2e60b28c903410b3707e59644f9e9dd691e25e7cc50896d99bd20ad7ab739","observation_id":"71147a4d-554d-49c4-9a14-36482330852e","resolution":{"observed_at":"2026-06-28T19:32:35.201951Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:358b3e6e655e9863d94c39279a0581f1124491188e653799b0d260f9897f0f7b","observation_id":"535d8e79-3b45-4fd1-9449-d2dc2140227d","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:4ee7b1b6d124635f8e8ebf956195df3a6d33f2f604ebafbefb87f9bdea0c939f","observation_id":"5bb397b9-69dd-4843-9b99-df24ee2786cf","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:47c1b35fc108553a6df08aa32b3f6d3f29f52905abf40cf146110075edcedf39","observation_id":"c1eb66ac-bb9a-4fb9-bb52-8d3eae5b8bf3","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:bd606de66028d5b6e16ce1d724d31fc064144372e99cab9ceada12c293d3d6d1","observation_id":"333895bc-9348-497e-bf2a-7fd1cb9bdb12","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:56155130e210aaa8f457916cecd79153541f4da1160d11ddb6c1ff3fdcd95081","observation_id":"dc68aadd-8da5-427c-ba51-90623f87ebd8","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06635","last_updated":"2023-06-11T09:41:37Z","snapshot_observed_at":"2026-08-04T01:23:23.304778Z","submitted_at":"2023-06-11T09:41:37Z","title":"2-D SSM: A General Spatial Layer for Visual Transformers","version":1},"cited_work":{"arxiv_id":"2306.06635","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.06635","snapshot_observed_at":"2026-06-28T19:32:35.216363Z","title":"2-d ssm: A general spatial layer for visual transformers","venue":null,"work_id":"bd15b6f6-80c6-4e4e-8a31-4a7c849ae02c","year":2023},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"cited_paper":"/paper/2306.06635","citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:ad00261d4240e7fd97b92cd14c6ab4835ef98887cfacafb6fbb39017f0d84840","observation_id":"566340ec-ba00-4ad5-8371-3c2852582c13","resolution":{"observed_at":"2026-06-28T19:32:35.217870Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"and Ermon, Stefano and Rudra, Atri and R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:fed3ea76cc56a6e1598123b230fcb53d34d91aeb7d2905f83d8c4236356286b5","observation_id":"59b611c4-1d54-4c76-bd6c-98ec4a5901d9","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:9a5539f7927baf99a0cdd54f55b694902539965dab054166d6fb94209b9fc93f","observation_id":"3cbdcdf3-b3c5-4ec3-abbf-18cb65df655a","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:8e7fd469698b4b6172a389dcf68b8acd313e0bfc8b3b9351d09f49cd82dd8807","observation_id":"5b250ba5-2671-4fe4-939e-c99577070ff1","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:f94cecfe33a44850c1483137fcdc70be89d2e9bb08e518a9a2165265e6e0c079","observation_id":"d1d22a2d-e22d-4d69-b280-0be66d5b8c5d","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":"CVPR , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:8e3746c84a1235f029e2b66ca6d2a991778a2a2aee916ab416efe3bea10dd5b2","observation_id":"0546a1a4-d3f9-4e06-88af-a41ed99613b0","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T19:23:08.100056Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-06-28T19:23:08.100056Z"},"links":{"citing_paper":"/paper/2606.00746"},"observation_digest":"sha256:6d0d7acb416331b8da09a130b00ba984a014047699a076ed1f1ce573f718498f","observation_id":"4ac70d08-89e4-4fe5-bff7-2fb62d2dd413","resolution":{"observed_at":"2026-06-28T19:23:08.100056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.00746","last_updated":"2026-05-30T14:29:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:29:43Z","title":"Scaling Parallel Sequence Models to Foundation-Scale Vision Encoders"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":23,"parse_uncertain":0,"unresolved":74,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":182},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 100 of 182 outbound references and 0 inbound Pith citation observations for arXiv:2606.00746."}