{"as_of":"2026-08-08T15:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c9875059c44d5f42104ccc813658b5b11697bded133f4c646bd4987f9869e0d9","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:55:40.776768Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T06:02:40.158866Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T06:07:22.539904Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"cited_work":{"arxiv_id":"2505.16993","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.16993","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Native segmentation vision transformers","venue":null,"work_id":"3d615dba-1c33-432e-b263-42d6f705646c","year":2025},"citing_paper":{"arxiv_id":"2605.12491","last_updated":"2026-05-12T17:59:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T17:59:26Z","title":"Elastic Attention Cores for Scalable Vision Transformers","version":1},"reference_index":118,"source":"pdf_text","source_observed_at":"2026-05-13T06:02:40.158866Z"},"links":{"cited_paper":"/paper/2505.16993","citing_paper":"/paper/2605.12491"},"observation_digest":"sha256:e040df38698881283a566d141490df09a0221b389dce5db66e12e24373ee1417","observation_id":"ade4aadf-4816-44a2-9198-566b2ec09f15","resolution":{"observed_at":"2026-05-13T06:07:22.541489Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16993/citation-record","integrity":"/paper/2505.16993/integrity","json":"/paper/2505.16993/citation-record.json","paper":"/paper/2505.16993"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:34.491663Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:34.491663Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:6e4f711715f294e0ea74d53061f1897e2a525ce545db718f55b6d9cb2fba4694","observation_id":"2460445c-9575-432c-a64a-35e294bcf3ca","resolution":{"observed_at":"2026-08-07T14:55:34.491663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:50.490369Z","title":"Convnext v2: Co-designing and scaling convnets with masked autoencoders","venue":null,"work_id":"5269942d-e456-4c4b-a0ec-ea83f49eaff4","year":2023},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:34.575933Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:adfe09b4cd6b8fbc0871e95ecb7f723dc6af5ef00c4abd24b928160f3f65adf4","observation_id":"39342ace-32b9-4815-9690-66756b5c6ab3","resolution":{"observed_at":"2026-08-07T14:55:50.558282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:50.375551Z","title":"Neighborhood attention transformer","venue":null,"work_id":"b2d0db65-5e14-40cc-ba58-0753c1e0e0eb","year":2023},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:34.685306Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:7baa3758c95c6654600c9b9f3ba47f00fee67f877be14f3a083bca500e9d6842","observation_id":"f518c955-48b5-4dc5-a695-53331bd64673","resolution":{"observed_at":"2026-08-07T14:55:50.429716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:34.815187Z","title":"Backpropagation applied to handwritten zip code recognition","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:34.815187Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:d585fa93a0a1ede2982b2ea2f339e9932d1d10f1a55694a9bb3903f9bb207e6a","observation_id":"969585b4-5aa4-4515-985d-81316a64135c","resolution":{"observed_at":"2026-08-07T14:55:34.815187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:34.922357Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:34.922357Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:b0cb85f69290847317f59b5f5f90e76bb87fb248d0aecdc58b7ca98f1b71e2e0","observation_id":"a9843379-0ad2-44e0-a301-20e7a7d3e85d","resolution":{"observed_at":"2026-08-07T14:55:34.922357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:35.010276Z","title":"Schwing, Alexander Kirillov, and Rohit Girdhar","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:35.010276Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:cda8b0108b17b76eeead7b4b1307d290fe5eadb437b52fa29b6cc809fe33d6a2","observation_id":"da6f51d4-8ab3-42fd-99f6-aed459b366ac","resolution":{"observed_at":"2026-08-07T14:55:35.010276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:35.085000Z","title":"Feature pyramid networks for object detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:35.085000Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:7e5c37966b8f48427450b5fa8f7dbd6d234f3452e848e7fd7fdcffa698e6df64","observation_id":"cdb95e00-622d-4ef2-8539-659d45743bd9","resolution":{"observed_at":"2026-08-07T14:55:35.085000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:50.202420Z","title":"FaPN: Feature-aligned pyramid network for dense image prediction","venue":null,"work_id":"2ae1f4a5-a487-4bac-95f9-a8594d09060a","year":2021},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:35.224616Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:3e06b47b59d49e86a80cc1911c4d66f665a8e21c200a125bfbd9a2cafd09ee26","observation_id":"991767dd-4efc-4e69-9305-9957da71bd7f","resolution":{"observed_at":"2026-08-07T14:55:50.262110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:50.047141Z","title":null,"venue":null,"work_id":"dd5f7907-3b5d-45f4-9a33-659ffce05ea9","year":2022},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:35.321961Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:6215c586ee943d432f28ff1f7c23e0359c31b4074b242244e224d3a4eb5e7800","observation_id":"ee282015-9ab6-4dc9-a550-1d84fc6a92af","resolution":{"observed_at":"2026-08-07T14:55:50.132482Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:49.926057Z","title":"Clusterformer: Clustering as a universal visual learner","venue":null,"work_id":"80950b99-36a0-414c-a3c4-cb811014f6ce","year":2023},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:35.479711Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:905a68d0595bad8a6027b1d60c90df2e0f7fa382ed3b2dafb518bfad4190cf50","observation_id":"3e5f1493-744d-47ed-934f-63537f47f13b","resolution":{"observed_at":"2026-08-07T14:55:49.967714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:49.813280Z","title":"Learning hierarchical image segmentation for recognition and by recognition","venue":null,"work_id":"5ad3cdae-e3e4-410e-ad5a-86a9dcd1d4c0","year":2023},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:35.562953Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:0ab6a02e584b45db48fc26793d4a08b8ab1cc0d81f98c3d409fd5e5cedc24067","observation_id":"fa701606-54c5-4881-b075-b7c7e1865346","resolution":{"observed_at":"2026-08-07T14:55:49.870902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:49.689712Z","title":"Tcformer: Visual recognition via token clustering transformer","venue":null,"work_id":"0016b373-9e4e-48d5-892c-e4a2bee7aa21","year":2024},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:35.643011Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:5566497f446881f43f0b4aa70b919252ab18a6cf4b63e8da36f36d10fca64351","observation_id":"15597a3d-7613-4f33-8943-a46cfd1b6687","resolution":{"observed_at":"2026-08-07T14:55:49.742996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:49.517038Z","title":"Schwing, and Alexander Kirillov","venue":null,"work_id":"0da441b2-4e05-491b-b14f-1b5234b46d80","year":2021},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:35.735251Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:2a237e669a5f019da31e9780299746b0fc274ea7aa0e26ab2bc1d84b185244e8","observation_id":"2d765e73-8eea-41de-9bc5-055e8bb36032","resolution":{"observed_at":"2026-08-07T14:55:49.604488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:49.333583Z","title":"Slic superpixels compared to state-of-the-art superpixel methods","venue":null,"work_id":"244d73fd-d6c4-4989-9a2f-b77dcc81be6a","year":2012},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:35.837086Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:d14802971d39d89cd98f50a9599236e5466457352ec9fddaeb013c9020db9412","observation_id":"6f38e803-886f-4711-aeef-f7b547b01593","resolution":{"observed_at":"2026-08-07T14:55:49.402810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:49.144815Z","title":"Object-centric learning with slot attention","venue":null,"work_id":"de3caffa-2c73-45e1-b1d8-5130947d3a54","year":2020},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:35.935254Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:dd462bf1f9187aef3ffb60af904350a9fce0cf017515e10a6f7323fca18cae13","observation_id":"8bd76a18-d8a2-42f5-999d-27a3bca78879","resolution":{"observed_at":"2026-08-07T14:55:49.233922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:48.957401Z","title":"Mean shift: A robust approach toward feature space analysis","venue":null,"work_id":"5de298e0-feb0-4f54-a2dd-e5045569bbd9","year":2002},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:36.074370Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:b621bf7074f9e3f7621743159f6ea4285359efc53c23bbc3ee7707c313a40804","observation_id":"2fa49496-b243-4745-a451-4f5bb7571d4b","resolution":{"observed_at":"2026-08-07T14:55:49.016911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:48.804676Z","title":"Felzenszwalb and Daniel P","venue":null,"work_id":"48d4d2c5-44d9-4e3d-9cfc-220217ed0964","year":2004},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:36.168668Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:e49e389e3c11e9c48fdd2126f1cbbdcdf33e2201a45753dee7b3a4bce9e39dcc","observation_id":"f1abbd73-3554-4b10-82bc-659c6ddb72ae","resolution":{"observed_at":"2026-08-07T14:55:48.853816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:48.626924Z","title":"Contour detection and hierarchical image segmentation","venue":null,"work_id":"74dffdb0-ce85-41e6-b918-bba4c1af4fb6","year":2011},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:36.279399Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:cade63555aef6085dcd233c3f63ba3a0cbe78ff110aa44b05c5dce3b08408db6","observation_id":"b6cc0892-2632-4d79-a46b-dea5645c87d8","resolution":{"observed_at":"2026-08-07T14:55:48.710783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:48.482630Z","title":"Seeds: Superpixels extracted via energy-driven sampling","venue":null,"work_id":"b8f7d252-cb37-4e92-8783-83d04d314733","year":2012},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:36.403076Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:1f62025aaa339dab4ad5b9db4db91fedbc1a8fcf2fe8bd688c44f5416560065d","observation_id":"6909a4cd-4635-4a9c-b02d-8368068fba64","resolution":{"observed_at":"2026-08-07T14:55:48.536144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:48.309349Z","title":"Semantic understanding of scenes through the ade20k dataset","venue":null,"work_id":"5119e17f-433e-4d68-a593-81b75d633876","year":2019},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:36.473035Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:77c14960adffb8f43aa0a36d5d266dc0b434ff3d7220849b093d177e0d92ebdf","observation_id":"6f8390d9-e7de-427f-ba63-7e7c1684f633","resolution":{"observed_at":"2026-08-07T14:55:48.395546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:48.150834Z","title":"Panoptic segmentation","venue":null,"work_id":"19326935-0da1-446a-b2a1-7163f1c078a5","year":2019},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:36.569923Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:6a723fd26c2cb5da6dce13b362cb446f92f49beaced327a9759cca5321359298","observation_id":"22559590-2a4f-410d-bdfa-744dd9271f2f","resolution":{"observed_at":"2026-08-07T14:55:48.202978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:36.693822Z","title":"Neocognitron: A self-organizing neural network model for a mechanism of pattern recognition unaffected by shift in position","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:36.693822Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:f6acc692e303905750ac825b569862f2062e2e22a5860f769be1e50550a3c6a3","observation_id":"cc44dad6-1121-4f2f-a77c-7b88b2bded88","resolution":{"observed_at":"2026-08-07T14:55:36.693822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:47.977913Z","title":"Gradient-based learning applied to document recognition","venue":null,"work_id":"a3d4ad5e-d840-46e1-9224-c2e1465e67b1","year":1998},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:36.746616Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:2c971b598ab60082990a2e5dbe842185415e12e720d230aaadc8a9eb4d662027","observation_id":"60d9cf58-f5f8-4f77-9266-976677bb21c0","resolution":{"observed_at":"2026-08-07T14:55:48.038344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:36.825137Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:36.825137Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:ae3d1dff0db4ad77f6c1151255ac3a8bdda8dc8fa662ca2dd2d73cf8d12d0203","observation_id":"11364c9b-1f78-438f-add2-63c1c7732b99","resolution":{"observed_at":"2026-08-07T14:55:36.825137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:36.922349Z","title":"A convnet for the 2020s","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:36.922349Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:8dfdfafb74f5bd15595ed33b39af13fb51f77396db201774ae53534a32608941","observation_id":"edb1c32d-38b4-47cb-b971-d50f5cdb5fe7","resolution":{"observed_at":"2026-08-07T14:55:36.922349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T14:55:37.004068Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:37.004068Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:9cd37635eaf55cb3fd5dcfeaee3c5c33725f9d0cb0ba0ca4f8ab7f515cc8b346","observation_id":"0350cb82-c86e-4800-bd90-f7e8a3f9b611","resolution":{"observed_at":"2026-08-07T14:55:37.004068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:37.099662Z","title":"Fully convolutional networks for semantic segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:37.099662Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:8cf1bbea2144ccfde429083a6aa09280e75cc50bc60443f90a0a8047f7db8071","observation_id":"9851423e-6728-49b0-a99d-6c901950ccb1","resolution":{"observed_at":"2026-08-07T14:55:37.099662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:47.749748Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":"d0335ea2-cddf-4115-8144-8c6a19af3209","year":2015},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:37.172521Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:ee0572ebf9e3aef2ea684a3cee6f6ff49cfedbf2547b4187af11ed844f9041d5","observation_id":"8e70d7bb-005f-436d-adb4-ffaa0f5b9655","resolution":{"observed_at":"2026-08-07T14:55:47.850044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:47.571806Z","title":"Rich feature hierarchies for accurate object detection and semantic segmentation","venue":null,"work_id":"5cc166e6-9392-4d56-a423-57aa1b751414","year":2014},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:37.259829Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:876362bd7158f6f9736a4ed81b68d94f50945ea0b43f2a27c313519cba853e1b","observation_id":"7296edd4-bfdd-41fa-b45b-d1ef3d797e07","resolution":{"observed_at":"2026-08-07T14:55:47.634897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:37.360904Z","title":"Fast r-cnn","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:37.360904Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:24028c2c9aa1fd29e5d8eaabeaca9ef40973ba136a19418772b9161f2805415b","observation_id":"4617a109-394d-4a8d-b17d-2a6863660fa7","resolution":{"observed_at":"2026-08-07T14:55:37.360904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:37.466195Z","title":"End-to-end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:37.466195Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:9722bbb73c1450b200f080964e0f994d42655c0946ba05cd8fc2e91b2f2f9798","observation_id":"abbb1278-5402-40c8-b8a9-a796dda25b68","resolution":{"observed_at":"2026-08-07T14:55:37.466195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:47.288304Z","title":"Normalized cuts and image segmentation","venue":null,"work_id":"1aebea02-3f2e-44a5-a4c6-be19eb82ec31","year":2000},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:37.548532Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:8eeea2d8ecec4c9e58c84fc53274d5e688db43447fd885a88fa6f34ddcc3a24e","observation_id":"e95186b4-c75a-4946-8c30-eb2aae10353d","resolution":{"observed_at":"2026-08-07T14:55:47.416823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:47.133838Z","title":"Multiscale combinatorial grouping","venue":null,"work_id":"e530d4a1-768c-4423-9aed-6eab75712972","year":2014},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:37.643606Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:e6e5e7c37d3bfc506b5f0e81aa887b2cb5ff0807d32e14b731e24115a743199b","observation_id":"2a1bbe62-2422-4b2f-9320-d17f37cbd3cb","resolution":{"observed_at":"2026-08-07T14:55:47.198109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:46.913484Z","title":"Superpixel samping networks","venue":null,"work_id":"980203e7-41d2-4526-8679-dc3ebf723dee","year":2018},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:37.702010Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:3948ae92a74d43ac4103a00bf34c02e628794ac3fb41e7aa2545c38f49c41429","observation_id":"46dc9746-5865-474f-b668-83260ca4fe38","resolution":{"observed_at":"2026-08-07T14:55:47.016623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:46.706813Z","title":null,"venue":null,"work_id":"c5c1c820-3fce-484d-a062-f6da053ccaa2","year":1957},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:37.819714Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:1faee895b4d63ee2768f3b7e196ee8fa07e5f33ba8220d04ff92bcdb7dd4bdac","observation_id":"abda8ddf-d305-4097-8a72-bf103965d096","resolution":{"observed_at":"2026-08-07T14:55:46.802461Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:46.473125Z","title":null,"venue":null,"work_id":"6f3c1a19-1715-42b7-9e00-24add3d1d896","year":1967},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:37.930389Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:29ac8ff69ee368d7fadc75f889a1e7d9babc0eee1618d69c021b480c2581ccf1","observation_id":"db5cc85c-a4f2-48a8-b46e-064f879dc9a9","resolution":{"observed_at":"2026-08-07T14:55:46.557896Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:46.311672Z","title":"Unified perceptual parsing for scene understanding","venue":null,"work_id":"277b7f9d-c122-4c54-ac1b-4a4ba16893ad","year":2018},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:38.018959Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:e61d6b554933af7329e1225b1215c6d11a3cbed21cdb0b944bfee10c55329d98","observation_id":"9eca3a2d-053d-4021-b61b-b205ef653898","resolution":{"observed_at":"2026-08-07T14:55:46.374569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:46.127601Z","title":"Berg, and Li Fei-Fei","venue":null,"work_id":"37a9e10c-a4ab-42dd-bca3-0e5092e18bb9","year":2015},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:38.112464Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:4a8e3b5385fbc7b45e9e56cb9f9cc51cc22dc6d467b5088e7814a398b38a2c1b","observation_id":"58de59c6-c80f-492b-a683-8e12dfa77e14","resolution":{"observed_at":"2026-08-07T14:55:46.201278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:38.182246Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:38.182246Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:eb0b20e6847959e008af8063a2a9f27cb804ef00809f61ba1f67958e59846637","observation_id":"e4bb2b64-dfeb-44b8-8a9f-32b9a46018a4","resolution":{"observed_at":"2026-08-07T14:55:38.182246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:45.922183Z","title":"Le, Yun- Hsuan Sung, Zhen Li, and Tom Duerig","venue":null,"work_id":"2ebab3c2-a0f1-4f99-8188-25fd4afc4f97","year":2021},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:38.254570Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:8df4653fc345f6af364a7dd8addb6d638b822d1b5f9b138299b9d5225e3905e3","observation_id":"051e48ba-726e-45b9-b577-5958b6803ef4","resolution":{"observed_at":"2026-08-07T14:55:46.027620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:45.764642Z","title":"A simple framework for text-supervised semantic segmentation","venue":null,"work_id":"d3e614c5-829b-45da-8318-05c32bf2f31f","year":2023},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:38.330391Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:74e3d59072cf757f2d71939a5a1f76702d1245bb22feec7cf688823a53b3b102","observation_id":"4c5dfd3e-7978-414e-93c7-3a0c2cfde865","resolution":{"observed_at":"2026-08-07T14:55:45.829111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:45.601406Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":"e3739120-9e9c-4bb5-a5ba-bdf711d8ef54","year":2018},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:38.424956Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:7695112f5f37453e500be5aac4fb9a73c61700701704d9b1117c2b1ee1543323","observation_id":"522dc38d-724f-4e3d-bd7d-5badc2072f75","resolution":{"observed_at":"2026-08-07T14:55:45.691037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.08981","last_updated":"2021-03-30T08:20:34Z","snapshot_observed_at":"2026-07-06T10:42:19.278531Z","submitted_at":"2021-02-17T19:15:53Z","title":"Conceptual 12M: Pushing Web-Scale Image-Text Pre-Training To Recognize Long-Tail Visual Concepts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.08981","snapshot_observed_at":"2026-08-07T14:55:38.530639Z","title":"Conceptual 12m: Push- ing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:38.530639Z"},"links":{"cited_paper":"/paper/2102.08981","citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:4cb3e15ae45b05ca7e292c7c5e449ab92028557410df73f7ce71734f79371f0c","observation_id":"4b1d9c74-8136-437f-94e8-736a37685071","resolution":{"observed_at":"2026-08-07T14:55:38.530639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:45.434729Z","title":"Redcaps: Web-crawled image-text data created by the people, for the people","venue":null,"work_id":"69034d4c-7d94-4912-a43c-89eb32b2d4a9","year":2021},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:38.622568Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:996ee7e017a06cbced2ad7a93d184700e180ae0cdf6e2e96bcb9e3b10a016933","observation_id":"7663898a-73b5-447d-912e-d66af4100685","resolution":{"observed_at":"2026-08-07T14:55:45.509767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:45.211099Z","title":"Learning to generate text-grounded mask for open-world semantic segmentation from only image-text pairs","venue":null,"work_id":"d8b4124c-2489-4751-98a5-cea7d614fa25","year":2023},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:38.698678Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:6d18881a73e566b8605fbebf6c1cc6d7cefe5c8db65606ba646f29ea52ad1722","observation_id":"421a5750-7cb4-45b2-844d-c2068675156c","resolution":{"observed_at":"2026-08-07T14:55:45.310461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:45.015526Z","title":"Everingham, L","venue":null,"work_id":"6f389626-36ff-4540-8d02-7c7aebe9b4fb","year":2010},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:38.790705Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:8ba16462706272ac1ec967bba516ef53eb46536773b04d50c92874c7c7d32d4a","observation_id":"e6c0e57e-0842-4104-93aa-39c716c4ff09","resolution":{"observed_at":"2026-08-07T14:55:45.134327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:44.812408Z","title":"The role of context for object detection and semantic segmentation in the wild","venue":null,"work_id":"955372eb-b2b5-4346-861d-25a4fbd50d2f","year":2014},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:38.870638Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:1e39e08875598a0ec8de5aff3bcf456c23cfbdeda40d514409b7b80b868acb9d","observation_id":"72274a1a-d26c-4238-8e16-a879ee05c245","resolution":{"observed_at":"2026-08-07T14:55:44.877729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:44.671913Z","title":null,"venue":null,"work_id":"f986d792-6c51-49b2-bc46-dd3a049f4df4","year":2014},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:38.933552Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:9a0773d6e1cb890774b614eac9918d0016a582d91a95d3128ab83091362ed6b3","observation_id":"12ff2374-85bd-42dc-a2a2-3e24c9307cc2","resolution":{"observed_at":"2026-08-07T14:55:44.748497Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:44.450357Z","title":"Coco-stuff: Thing and stuff classes in context","venue":null,"work_id":"ad275879-6904-4e1f-b0f1-4502ebc94b8d","year":2018},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.012943Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:5488ddfae2c3fda6348f144f0fab7b79b9654432fff5493aa74a9b5906c95f11","observation_id":"0863d82c-10c4-4e67-9774-4d4e6d0519a9","resolution":{"observed_at":"2026-08-07T14:55:44.550601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:39.058264Z","title":"Cordts, M","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.058264Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:613cf5ba06aec293cfc65ea9ce8e51e391282eeecc3c0259779ce5123b459335","observation_id":"45573f47-e3d0-44e4-acab-46e74982d378","resolution":{"observed_at":"2026-08-07T14:55:39.058264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:44.249888Z","title":"Open- world semantic segmentation via contrasting and clustering vision-language embedding","venue":null,"work_id":"2de55433-1c1b-4bd3-a4a8-1b31c3e192e1","year":2022},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.128618Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:ad403afaeec9f205c286fc171a2ec82a5e29eb73cbe2e05a620ae0673614613c","observation_id":"971d4e1d-0360-4075-8853-572bf21cf678","resolution":{"observed_at":"2026-08-07T14:55:44.340556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:44.091107Z","title":"Segclip: Patch aggregation with learnable centers for open-vocabulary semantic segmentation","venue":null,"work_id":"e2905972-49f4-47db-afd8-dbd61cbe6c06","year":2023},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.200859Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:c6d3e9adc1024a97950e18585a8c7d9b9dcb3acc754859dec8aee08a1f706b2c","observation_id":"c5829d93-cf5c-4493-a113-a528c55e49b4","resolution":{"observed_at":"2026-08-07T14:55:44.151077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:43.905064Z","title":"Image-text co-decomposition for text-supervised semantic segmentation","venue":null,"work_id":"2c6d2836-7e0b-4e44-92d1-0db42b1e1903","year":2024},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.283083Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:cf4d6265d37ae0c5f845b51b6a35dad97538f2e0cd4812d70d64a0d843a4b15c","observation_id":"e922457d-570b-402d-829f-1ed192d4d53b","resolution":{"observed_at":"2026-08-07T14:55:43.994656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:43.709898Z","title":"Viewco: Discovering text-supervised segmentation masks via multi-view semantic consistency","venue":null,"work_id":"ad5c8e42-6603-4feb-aac3-5f8eace3c57a","year":2023},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.361768Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:366f53efb58373f886a24b8787db4b2176c01afb0483927dba2c8200822b12b2","observation_id":"fab32581-2094-4638-8719-105837d4e6f9","resolution":{"observed_at":"2026-08-07T14:55:43.799254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:43.531308Z","title":"Rewrite caption semantics: Bridging semantic gaps for language-supervised semantic segmentation","venue":null,"work_id":"60d5d938-c6bb-4c92-a087-7ed7f416edd8","year":2023},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.421485Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:d5d11a98a851e941ed3466ea0643d7de3464ad811243f0293de3ac65c113e2e6","observation_id":"8fc88444-f9a1-41e5-9db4-72413e568c66","resolution":{"observed_at":"2026-08-07T14:55:43.625993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:43.393304Z","title":"Uncovering prototypical knowledge for weakly open-vocabulary semantic segmentation","venue":null,"work_id":"34679ce6-f54a-4735-8f7e-d1cc22fac22b","year":2023},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.494191Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:f54096c8fdba38392f634a364b0646851b97c6f35208fe0769570ffe17aa4688","observation_id":"fc8b093b-d0cd-47b1-a17d-aabcc22eb2f9","resolution":{"observed_at":"2026-08-07T14:55:43.458392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:43.231424Z","title":"Efficient inference in fully connected crfs with gaussian edge potentials","venue":null,"work_id":"55679ae6-5096-4564-a0ff-ee9af7d9fb16","year":2011},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.625717Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:665c66baeba8e7eeda9d5bf07766daa95f1de1f0ec5b267fdae12c267ca44be5","observation_id":"6ca380dd-fdbd-4b8c-ad63-df2fcdf1a52a","resolution":{"observed_at":"2026-08-07T14:55:43.313744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:43.121098Z","title":"Single-stage semantic segmentation from image labels","venue":null,"work_id":"52d5bf93-e869-4250-9cf6-deaeee4cb226","year":2020},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.659409Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:4b289ee006095087a1067f7fa79c469442c5685aaf95a6574c0a179173d96454","observation_id":"10d3c55d-06db-4062-bd14-7ef921ee45ea","resolution":{"observed_at":"2026-08-07T14:55:43.172338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:42.963012Z","title":"Vmamba: Visual state space model","venue":null,"work_id":"6ead9292-f8fc-463e-8c4c-8801f59e5e28","year":2024},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.699866Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:3f4d6db258ee213f38b5165b383a4b62148f66742c466d285f5fbcbcc6f638ca","observation_id":"c961662f-da5d-4207-8db6-5a18fcc46496","resolution":{"observed_at":"2026-08-07T14:55:43.049455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:42.812313Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"1c01dfd6-7078-410b-b0c7-acec76f40613","year":2024},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.776032Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:d2e2d6ab79e0c9b2b91eac3fa80e37116d9bfb57981eb6aa55cef3bb4cb8a18f","observation_id":"dec6cc42-45af-4d31-ac73-3f8f589fe156","resolution":{"observed_at":"2026-08-07T14:55:42.871618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:42.707495Z","title":"Panoptic feature pyramid networks","venue":null,"work_id":"76e3329c-1e04-4fb7-ba4a-530d8c8c0414","year":2019},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.859502Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:67ee316e6b7c04430e78a3296b573ab7cb39a9509d77c9491507fcad6ce07b36","observation_id":"67f73f93-4e98-4907-9f6a-301595fefb4f","resolution":{"observed_at":"2026-08-07T14:55:42.750426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:42.523384Z","title":"Segmenter: Transformer for semantic segmentation","venue":null,"work_id":"fb33ae30-6951-4689-8680-0020e887c414","year":2021},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.938874Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:89e8795a7b52bbaed4af8c6c610c67deac04cae2c053f78bee5b30e21ab2768c","observation_id":"d62ce440-cb23-407d-a27d-786cc8396158","resolution":{"observed_at":"2026-08-07T14:55:42.618951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:42.399654Z","title":null,"venue":null,"work_id":"a01719bf-d746-48ab-90b6-1c5da218076e","year":2023},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:39.973272Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:cfc99a1b94e51557b23ca51e5209e3e0f9230a863376db4fdd32169d27249da6","observation_id":"40dc5a72-0625-40f4-8cc7-38b435006774","resolution":{"observed_at":"2026-08-07T14:55:42.424557Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:42.270771Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"ec225d5e-2263-4e8e-af7f-0326df531a86","year":2024},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:40.084480Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:13d1003171d7c1cdd9219f7e05b26fb1faeb44dde32f79ca1661518ce0fab9b3","observation_id":"a3bbe0f1-d2f1-4079-87cf-a4b174ad51be","resolution":{"observed_at":"2026-08-07T14:55:42.334089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:42.127099Z","title":"Self-attention with relative position rep- resentations","venue":null,"work_id":"1bae3666-723a-4e26-accf-e305d3a98915","year":2018},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:40.167748Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:1af01ab007f0d8589c14c9bfa03f5ea81476abfe6941845134e209ef8d21d571","observation_id":"1f78a695-9c15-4dbe-9b6a-30f1560e0474","resolution":{"observed_at":"2026-08-07T14:55:42.192849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:42.008184Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":"299f92ad-6280-408b-a16c-63e9355a5753","year":2021},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:40.218252Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:faa8649ae5aa13ae9f0f4104d8ace814f0e3a10f40cec8c0ab9e954d4b32d90d","observation_id":"8c28d6ac-aa0c-4cb7-813d-7735c818d99a","resolution":{"observed_at":"2026-08-07T14:55:42.054391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:41.888152Z","title":"Rotary position embedding for vision transformer","venue":null,"work_id":"e8c896a8-031d-43d8-abc2-ab35388a4039","year":2024},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:40.261863Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:48cea0fa951286bb4112840b9c1cfcaca51d1d9944096c0144f5ebefa07e7843","observation_id":"437ba9f9-51cf-4272-8968-749e3242de6f","resolution":{"observed_at":"2026-08-07T14:55:41.934310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:41.695739Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":"6fc20e13-7128-48eb-849f-79b4728931a6","year":2022},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:40.305574Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:4229ca8a30a2e22beb335d8b0a957fc5ea22946d95754c697b0aa87abe37e250","observation_id":"bdfafc2b-bed4-4ea6-a779-5aaf230de942","resolution":{"observed_at":"2026-08-07T14:55:41.770603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:41.531799Z","title":"Faster neighborhood attention: Reducing the o(n^2) cost of self attention at the threadblock level","venue":null,"work_id":"884b23ea-c53c-4d87-9fb2-03766bafe430","year":2024},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:40.399294Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:85f1b144eb4aa0ed054829e29d0bfde31b2007637cdd8f536fb9aadfb06eff97","observation_id":"3f1e26f5-c66c-415e-bb6b-d6518d192254","resolution":{"observed_at":"2026-08-07T14:55:41.619633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:41.403275Z","title":"Training data-efficient image transformers; distillation through attention","venue":null,"work_id":"70e474f2-d4f8-4888-83df-d58c930a2468","year":2021},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:40.479785Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:1fd8e9dcc9b9c7563f51b87f6b9c73303dc6d2ba37a39e1e7c94658869eaa8a6","observation_id":"14e5460f-1f9e-4ca8-8d8e-684f2faea1de","resolution":{"observed_at":"2026-08-07T14:55:41.448153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:41.302009Z","title":"Weinberger","venue":null,"work_id":"0630a6c9-eaf7-4214-a826-ed643a21fb6e","year":2016},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:40.578280Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:e05ae0c230ba222fc27e4ffbffc28fbd404ca7b33143b1953fbac46da43aec73","observation_id":"8a207c97-2d2a-41fc-b4af-80f60be67ba7","resolution":{"observed_at":"2026-08-07T14:55:41.352789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:41.119249Z","title":"Empirically, we observe a negligible decrease of downstream classification and segmentation performance, and a significant increase in speed","venue":null,"work_id":"8acf015a-a787-47ab-a6fc-7b0531ecd4af","year":null},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:40.651143Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:95d0643af5deed9e5a3db5d6b798566f9853bd8b7dac16a1c5a7b8636fe95a8c","observation_id":"bfa2a9c9-10fd-4b9b-a662-2997cd397c59","resolution":{"observed_at":"2026-08-07T14:55:41.181944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:41.004742Z","title":"An image of {CLASS }","venue":null,"work_id":"af1e2725-5053-42f8-938e-c58b6abc956d","year":null},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:40.725910Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:01622794fe9598c60e1a0e30786170fa2e80c0fb6362d18eb0524c8489a0fde0","observation_id":"92b5b608-2b35-4808-89b9-bab8545c1252","resolution":{"observed_at":"2026-08-07T14:55:41.063393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:40.879805Z","title":null,"venue":null,"work_id":"20c130d6-5d96-486a-81c9-65b7a3b6bdba","year":null},"citing_paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:40.776768Z"},"links":{"citing_paper":"/paper/2505.16993"},"observation_digest":"sha256:4fe1755598df08dbd669b45e7b7028274e5ce5fc93ae3bd89dace7a935675d95","observation_id":"e32f542a-07bc-4bab-b9e8-6397532cc881","resolution":{"observed_at":"2026-08-07T14:55:40.952338Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.16993","last_updated":"2025-05-22T17:55:20Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T14:49:38.402814Z","submitted_at":"2025-05-22T17:55:20Z","title":"Native Segmentation Vision Transformers"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":53},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 1 inbound Pith citation observation for arXiv:2505.16993."}