{"as_of":"2026-08-07T16:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ac03222d29f651427776c5594ec524751a238acf19d648c599666b76235a33aa","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:01:23.882872Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.11131/citation-record","integrity":"/paper/2506.11131/integrity","json":"/paper/2506.11131/citation-record.json","paper":"/paper/2506.11131"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.729466Z","title":"Zerowaste dataset: To- wards deformable object segmentation in cluttered scenes","venue":null,"work_id":"c74fb107-ed37-4c5f-b0f1-58c9a849cb9d","year":2022},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.694098Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:c8d5b8a4eedb499b0b4a2358b73430ad8c191cfdc3ae4f8b34f4cc55725adda9","observation_id":"1e509b39-0717-4dce-a7b4-5ced0adbec71","resolution":{"observed_at":"2026-08-07T05:01:24.746199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-07-06T14:06:56.291161Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-07T05:01:23.698370Z","title":"To- ken merging: Your vit but faster.arXiv preprint arXiv:2210.09461, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.698370Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:8381113896929a999afaf58b39954a02e1efcaddef430f88c5afd045105ee2a4","observation_id":"28594f12-b209-49ab-a85a-cfe51ce3f4f5","resolution":{"observed_at":"2026-08-07T05:01:23.698370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.652292Z","title":"The eccentricity effect: Target eccentricity af- fects performance on conjunction searches.Perception & psychophysics, 57:1241–1261, 1995","venue":null,"work_id":"730f591f-30ef-4a53-b29a-26d0605f0a8a","year":1995},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.702224Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:021aa8194bd45eb0b846493da5f09de8a56e849ea6cd7fc946b50209c6b1c5d4","observation_id":"c86c28c2-8ee7-40b4-9a06-65874c14c5fd","resolution":{"observed_at":"2026-08-07T05:01:24.694667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.636882Z","title":"Pelk: Parameter-efficient large kernel con- vnets with peripheral convolution","venue":null,"work_id":"f40bcc23-1ff5-44c3-a9f3-072ce9af986d","year":2024},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.705985Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:e5031e82dd18041b3c4333d22c8548817c81f470f483276b58f409669934deac","observation_id":"e2183c98-8fcb-4a6c-bb8d-b4cd06db1fb2","resolution":{"observed_at":"2026-08-07T05:01:24.642470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.623487Z","title":"Diffrate: Differentiable compression rate for efficient vision transformers","venue":null,"work_id":"251ba3a5-3a25-48eb-b412-f30c5791d1b4","year":2023},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.709324Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:46b9538d7864151464301cab9b379048a3f9fbcf53ccda54b12067f71020f013","observation_id":"55063883-09bd-41a8-89dd-fafbd792858a","resolution":{"observed_at":"2026-08-07T05:01:24.627947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:23.712548Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.712548Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:e7558ceae1a53d74b0b2140dd8055bcaf7c5a19155e1b366989f4674304c8672","observation_id":"9b378b04-b665-45ab-af7e-f1ae93f46f5b","resolution":{"observed_at":"2026-08-07T05:01:23.712548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.602647Z","title":"Rescaling egocentric vision: Collection, pipeline and chal- lenges for epic-kitchens-100.International Journal of Com- puter Vision, pages 1–23, 2022","venue":null,"work_id":"952b6c37-e44e-4d4a-a30d-b3c00c90ab55","year":2022},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.716082Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:8ede99cfcd1449759dfb22e2048a0042aeb529c023851597ac9bf6822f6dad69","observation_id":"8327ace9-0161-4fb0-914d-af88c483025c","resolution":{"observed_at":"2026-08-07T05:01:24.607128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-07T09:40:32.614733Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16588","snapshot_observed_at":"2026-08-07T05:01:23.719371Z","title":"Vision transformers need registers.arXiv preprint arXiv:2309.16588, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.719371Z"},"links":{"cited_paper":"/paper/2309.16588","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:566b752a7263405a63cf1e6ae04ba91c798d8cddb491bb113fe4ca95ada991f4","observation_id":"55363477-3f56-4009-bd58-67cd24293673","resolution":{"observed_at":"2026-08-07T05:01:23.719371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.589033Z","title":"Epic-kitchens visor benchmark: Video segmenta- tions and object relations","venue":null,"work_id":"1cb208b3-04dd-4833-af5e-b92041dceec4","year":2022},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.722720Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:627e791a95c2263be95bbb8a72d319d568b225a21122feda002842b701a7f190","observation_id":"eaf99e91-6ff2-42c3-a664-fb632d5f4745","resolution":{"observed_at":"2026-08-07T05:01:24.593588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.570837Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"0a2d8c54-827e-4240-a2bf-3662122bc214","year":2009},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.725866Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:96e2d8c8f461849b7f48fdd57a84c938877375812b65c974e586411361479797","observation_id":"0f531688-f6f3-4537-9755-c3accd759b1f","resolution":{"observed_at":"2026-08-07T05:01:24.580040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T05:01:23.728704Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.728704Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:7290171f3f5d6560356c78a4505977c1eb6ebc91e5ffc6f355f079c132a831df","observation_id":"5bd0c6c2-48f7-406f-8e90-cb51c855634a","resolution":{"observed_at":"2026-08-07T05:01:23.728704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13561","last_updated":"2023-10-01T20:16:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T20:42:21Z","title":"Project Aria: A New Tool for Egocentric Multi-Modal AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13561","snapshot_observed_at":"2026-08-07T05:01:23.732463Z","title":"Project aria: A new tool for egocentric multi-modal ai research.arXiv preprint arXiv:2308.13561, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.732463Z"},"links":{"cited_paper":"/paper/2308.13561","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:84048140454ec919fd617d1af2e043c37ca322a0515cf885783fd863ef2a19c4","observation_id":"72ea821b-b086-4d6d-b65a-2f06aad9f9ab","resolution":{"observed_at":"2026-08-07T05:01:23.732463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.541101Z","title":"Adaptive token sampling for efficient vision transformers","venue":null,"work_id":"1242a42e-d9c9-4420-ad3e-aa8e1f6faa41","year":2022},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.735627Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:6523ee915641b9e259c58eda92bda9f56f4e39861c441b25ff9761b5d8652320","observation_id":"2b6c4ab8-f20c-40e8-8e11-08ac62ec1bf0","resolution":{"observed_at":"2026-08-07T05:01:24.554245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.490064Z","title":"Instance segmen- tation for autonomous log grasping in forestry operations","venue":null,"work_id":"8fbd75f5-c33b-4998-bb7c-c9d0f9f83a14","year":2022},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.738525Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:c819e81106d6823cc7ca210701deb62deaa3aa12ad835858ec6ad59a986854b5","observation_id":"21c265b8-1918-4a76-8f95-917f683ff375","resolution":{"observed_at":"2026-08-07T05:01:24.515908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.454158Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"c2dcc134-8f25-4b4d-9a50-994c80d30b8b","year":2016},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.741588Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:049ea901624b5d548aa6cd236a4ce25f89e4b7d7219239cf7210caa3328d0abc","observation_id":"99a98a1c-017e-41cd-a25a-d4f760767f8c","resolution":{"observed_at":"2026-08-07T05:01:24.463612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.441380Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"6bcc332e-b2e3-46f9-806e-d121e5dd1b40","year":2022},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.744538Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:b9b711e41d897e30bf3c6b9b324cbda97a8145c8147b65abdf08c0b07f676188","observation_id":"18b36cfc-202c-4303-b830-5c8676a3cd26","resolution":{"observed_at":"2026-08-07T05:01:24.445343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00238","last_updated":"2024-07-01T15:54:17Z","snapshot_observed_at":"2026-07-06T15:36:15.352301Z","submitted_at":"2023-05-31T23:18:21Z","title":"Bytes Are All You Need: Transformers Operating Directly On File Bytes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00238","snapshot_observed_at":"2026-08-07T05:01:23.747349Z","title":"Bytes are all you need: Transformers operat- ing directly on file bytes.arXiv preprint arXiv:2306.00238,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.747349Z"},"links":{"cited_paper":"/paper/2306.00238","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:1f53173109c511e93c801e0d285330bfac97f1939b9ce87669c3a4d4b478cf85","observation_id":"73d796ab-7a26-4cb7-a8bc-8af8e40e5868","resolution":{"observed_at":"2026-08-07T05:01:23.747349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14173","last_updated":"2022-10-02T19:59:49Z","snapshot_observed_at":"2026-07-06T11:13:54.995111Z","submitted_at":"2021-05-29T01:54:33Z","title":"FoveaTer: Foveated Transformer for Image Classification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.14173","snapshot_observed_at":"2026-08-07T05:01:23.751062Z","title":"Foveater: Foveated transformer for image classification.arXiv preprint arXiv:2105.14173,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.751062Z"},"links":{"cited_paper":"/paper/2105.14173","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:4dd3c0d8ca406746edb4891f70e1363dd77038537d5cf2ec40b64cffebd1769c","observation_id":"40a1255e-c691-4dd0-81b2-330d8e2c0bec","resolution":{"observed_at":"2026-08-07T05:01:23.751062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T05:01:23.754450Z","title":"Scaling laws for neural language models.arXiv preprint arXiv:2001.08361,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.754450Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:1b4467bd21fb2510d75bb4325a3b224d9e341b3bd63b1682dcd76c502753ef89","observation_id":"0fa90366-b06b-4c18-999a-852cc05fc66c","resolution":{"observed_at":"2026-08-07T05:01:23.754450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.429964Z","title":"Segment any- thing","venue":null,"work_id":"bc3561b1-73a5-4707-b973-2b6e75b86e44","year":2023},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.758293Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:316818f56f268c9e69eab074c020fe032da7f55d7d9eb1401f93a8c76d17fd0a","observation_id":"8e62f6ee-dc64-4cb4-96a4-a8b2d340878b","resolution":{"observed_at":"2026-08-07T05:01:24.433749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.419111Z","title":"Spvit: Enabling faster vision transformers via latency-aware soft token pruning","venue":null,"work_id":"47e4c4a8-5026-42af-abed-04a4a0d1615a","year":2022},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.761078Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:3b3e00d54a03019232dcd3b33df2627ff48be73f075c7265a3c9af7f740b9de8","observation_id":"c7db607a-ee3c-4385-8c74-e1c25ba8a50b","resolution":{"observed_at":"2026-08-07T05:01:24.422770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17217","last_updated":"2024-01-31T05:21:13Z","snapshot_observed_at":"2026-07-06T17:22:37.193255Z","submitted_at":"2024-01-30T18:02:44Z","title":"GazeGPT: Augmenting Human Capabilities using Gaze-contingent Contextual AI for Smart Eyewear","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17217","snapshot_observed_at":"2026-08-07T05:01:23.764359Z","title":"Gazegpt: Augment- ing human capabilities using gaze-contingent contextual ai for smart eyewear.arXiv preprint arXiv:2401.17217, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.764359Z"},"links":{"cited_paper":"/paper/2401.17217","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:9decb4d1c8b2ac01682adaeae6a99630123d919cc80e31a485bac707262d438b","observation_id":"9ca957d8-7dc4-43bd-9854-dd88108d4785","resolution":{"observed_at":"2026-08-07T05:01:23.764359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.407397Z","title":"Imagenet classification with deep convolutional neural net- works.NeurIPS, 25, 2012","venue":null,"work_id":"6e4ae14b-1d84-4e9d-9e8a-a3db01db1bb1","year":2012},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.767641Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:dfe04e5872854cf986e4d61c2c4c6ff7c74ba94f34576c5ba7c89654f34a9d57","observation_id":"590a6293-dc25-4f1d-9958-f665e0569fb0","resolution":{"observed_at":"2026-08-07T05:01:24.411540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:23.771069Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.771069Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:22dec36b093060e30b4591fab27eeda4a6f0f854af89fe678caecdcdef10652f","observation_id":"63c6b7bf-c21b-49ac-a983-781244081ff1","resolution":{"observed_at":"2026-08-07T05:01:23.771069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.386611Z","title":"Efficientvit: Memory efficient vision transformer with cascaded group attention","venue":null,"work_id":"f61e6ce7-3ed0-49a0-ab21-c98652ece555","year":2023},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.774471Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:2e09a7769f9f6871c54dd66766208bd1049cfb955bcf455a5a94cfbee5af95c6","observation_id":"36157df9-59b5-4627-a570-b74ea1f749c3","resolution":{"observed_at":"2026-08-07T05:01:24.390481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09905","last_updated":"2024-09-20T01:18:11Z","snapshot_observed_at":"2026-08-05T08:51:51.094594Z","submitted_at":"2024-06-14T10:23:53Z","title":"Nymeria: A Massive Collection of Multimodal Egocentric Daily Motion in the Wild","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09905","snapshot_observed_at":"2026-08-07T05:01:23.777693Z","title":"Nymeria: A massive collection of multimodal egocentric daily motion in the wild.arXiv preprint arXiv:2406.09905, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.777693Z"},"links":{"cited_paper":"/paper/2406.09905","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:6e430a24f5bf9c3a86fb33480d2280bc1d5abf2835356ca398a7a5477756e6ff","observation_id":"084b4e53-0296-46e9-af71-b67bc7baa978","resolution":{"observed_at":"2026-08-07T05:01:23.777693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.03860","last_updated":"2021-10-11T15:17:21Z","snapshot_observed_at":"2026-07-06T11:55:39.142653Z","submitted_at":"2021-10-08T02:22:50Z","title":"Token Pooling in Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.03860","snapshot_observed_at":"2026-08-07T05:01:23.781218Z","title":"Token pooling in vision transformers.arXiv preprint arXiv:2110.03860, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.781218Z"},"links":{"cited_paper":"/paper/2110.03860","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:0eb9a66a1a35b018f2e6f30960362f57cd2ae0e149a93cf7eae905eedfa64da2","observation_id":"788a1717-40dd-4ee4-8aa0-f37e6cdbb4a8","resolution":{"observed_at":"2026-08-07T05:01:23.781218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.373777Z","title":"Adavit: Adaptive vision transformers for efficient image recognition","venue":null,"work_id":"970ba642-a2dc-4c60-9cdb-eb3830c40007","year":2022},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.785126Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:4840cbf5465d65e6ed7767fc281de6f61f087391ca6184c4cff93c1d5340e165","observation_id":"a7e9de63-7a8c-483d-a0e1-f877df98dc81","resolution":{"observed_at":"2026-08-07T05:01:24.377985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.361814Z","title":"Peripheral vision transformer.NeurIPS, 35:32097–32111,","venue":null,"work_id":"a79ecbe5-fdef-4810-8fef-5b1a09668ba9","year":null},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.788274Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:6961d75fff93791d672e304f576657cc9727931ed6a4031b47e2749f90f34bd0","observation_id":"4c17ce08-a961-4e2a-b3ca-24f2b5bde1e1","resolution":{"observed_at":"2026-08-07T05:01:24.365746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.348737Z","title":"Finely-grained annotated datasets for image-based plant phenotyping.Pattern recognition letters, 81:80–89, 2016","venue":null,"work_id":"e4dfd7e2-00b4-49b5-a86e-077c52d1b0c8","year":2016},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.791261Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:e870a3c2377fec8aab5d4c6ef8a292308ef25c070963a635aa21b044b46c6047","observation_id":"f56ad5c0-676c-4893-aac9-98ab94bf32b6","resolution":{"observed_at":"2026-08-07T05:01:24.354346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.337795Z","title":"Rgb no more: Minimally- decoded jpeg vision transformers","venue":null,"work_id":"bb880c7f-1302-43fa-b175-c2d9abb0a73b","year":2023},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.794455Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:a0169dbca6e5e75d167e11ad6b2f558de9f5931c10480f798d4a000f227a60c0","observation_id":"1235dc9c-c215-4930-968f-9f7b0e3a0247","resolution":{"observed_at":"2026-08-07T05:01:24.341396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.326000Z","title":"Dynamicvit: Efficient vision transformers with dynamic token sparsification.NeurIPS, 34:13937–13949, 2021","venue":null,"work_id":"429cd63f-4d1d-4ee6-b9fb-a8fdfc1328d5","year":2021},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.797553Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:239fa03a032c077bb2e8c7f6ec413eaadebc67a73f6fd80da7fe515d58b89f04","observation_id":"cbf95ed2-4d45-4c90-a0bd-b8014a99c4cd","resolution":{"observed_at":"2026-08-07T05:01:24.329601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T05:01:23.800874Z","title":"Sam 2: Segment anything in images and videos.arXiv preprint arXiv:2408.00714, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.800874Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:beef052663dbde8a920809ea069980973c1f66db1d51cb410ff5f645ef070cac","observation_id":"69d40b15-99d7-4f63-8ae8-d2561eba0191","resolution":{"observed_at":"2026-08-07T05:01:23.800874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12015","last_updated":"2022-02-24T10:56:17Z","snapshot_observed_at":"2026-08-06T14:20:02.767018Z","submitted_at":"2022-02-24T10:56:17Z","title":"Learning to Merge Tokens in Vision Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.12015","snapshot_observed_at":"2026-08-07T05:01:23.804525Z","title":"Learn- ing to merge tokens in vision transformers.arXiv preprint arXiv:2202.12015, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.804525Z"},"links":{"cited_paper":"/paper/2202.12015","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:350025c210621ad8c39c9358f43e147b62f7cb73e8935bddd32481a1e35be027","observation_id":"c65e594d-c154-445b-a67a-def22ddd5241","resolution":{"observed_at":"2026-08-07T05:01:23.804525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04570","last_updated":"2022-03-09T08:15:14Z","snapshot_observed_at":"2026-08-07T12:27:59.371071Z","submitted_at":"2022-03-09T08:15:14Z","title":"CP-ViT: Cascade Vision Transformer Pruning via Progressive Sparsity Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.04570","snapshot_observed_at":"2026-08-07T05:01:23.807850Z","title":"Cp-vit: Cascade vision transformer pruning via progressive sparsity prediction.arXiv preprint arXiv:2203.04570, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.807850Z"},"links":{"cited_paper":"/paper/2203.04570","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:d675300f1dc7ec3b5358befe469d60704bfe3283f44cdaa0e78d97f98f15be15","observation_id":"7ccae9cd-45a8-41a1-a6a8-b6cb26b7a985","resolution":{"observed_at":"2026-08-07T05:01:23.807850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04960","last_updated":"2026-06-04T11:59:03Z","snapshot_observed_at":"2026-08-02T12:51:51.839797Z","submitted_at":"2024-10-07T11:59:54Z","title":"On Efficient Variants of Segment Anything Model: A Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04960","snapshot_observed_at":"2026-08-07T05:01:23.811323Z","title":"On efficient variants of segment anything model: A survey.arXiv preprint arXiv:2410.04960, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.811323Z"},"links":{"cited_paper":"/paper/2410.04960","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:346eb446cedc7dbf26d88096b7bff07ba4c8bdd34a07134ada88989641e34432","observation_id":"e8f10b38-f447-44eb-968a-3d3eaf864169","resolution":{"observed_at":"2026-08-07T05:01:23.811323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.13359","last_updated":"2020-05-27T13:41:39Z","snapshot_observed_at":"2026-08-05T13:03:02.618692Z","submitted_at":"2020-05-27T13:41:39Z","title":"NDD20: A large-scale few-shot dolphin dataset for coarse and fine-grained categorisation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.13359","snapshot_observed_at":"2026-08-07T05:01:23.814417Z","title":"Ndd20: A large-scale few-shot dolphin dataset for coarse and fine-grained categorisation","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.814417Z"},"links":{"cited_paper":"/paper/2005.13359","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:b59978dd71bd077d6e3b3fbba1e43b12f112005ee2693fd3b2ddae1ea0729c4d","observation_id":"d23f2a49-6e4d-41b8-84f9-aba653abed04","resolution":{"observed_at":"2026-08-07T05:01:23.814417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:23.818098Z","title":"Neural discrete representation learning.NeurIPS, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.818098Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:974452431d29a2bc02e5e0c811773c2fbbba36847b9fc0cfb4085fc42a6e7e03","observation_id":"43bd1eec-cba5-4ced-a584-1a7f911a7b8d","resolution":{"observed_at":"2026-08-07T05:01:23.818098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06736","last_updated":"2024-05-20T22:58:52Z","snapshot_observed_at":"2026-07-06T17:00:04.276081Z","submitted_at":"2023-12-11T16:04:22Z","title":"SqueezeSAM: User friendly mobile interactive segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06736","snapshot_observed_at":"2026-08-07T05:01:23.821808Z","title":"Squeeze- sam: User friendly mobile interactive segmentation.arXiv preprint arXiv:2312.06736, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.821808Z"},"links":{"cited_paper":"/paper/2312.06736","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:b8c25f5aec94f6b1817576989c48030c359f774802fe83611b28d8fab771171b","observation_id":"b4ca801e-802b-431c-a17c-b8c84bc54fda","resolution":{"observed_at":"2026-08-07T05:01:23.821808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.306172Z","title":"Efficientsam: Leveraged masked image pretraining for efficient segment anything","venue":null,"work_id":"c20c3e0d-7d8e-4aa1-81d9-82def6b20a66","year":2024},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.825145Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:c87707ac274fffbb9bd77d1b51e014e008e1e7c2dcb6c63362f7802ac4064fc4","observation_id":"39280563-a8b6-411a-928b-0b8736568912","resolution":{"observed_at":"2026-08-07T05:01:24.309971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08368","last_updated":"2025-02-02T19:28:27Z","snapshot_observed_at":"2026-07-06T19:31:31.809692Z","submitted_at":"2024-10-10T20:54:15Z","title":"ElasticTok: Adaptive Tokenization for Image and Video","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08368","snapshot_observed_at":"2026-08-07T05:01:23.828275Z","title":"Elastictok: Adap- tive tokenization for image and video.arXiv preprint arXiv:2410.08368, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.828275Z"},"links":{"cited_paper":"/paper/2410.08368","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:9ce91defdca5167a44b3093951117e127b2e452f4d1424245661df1d8f620bd6","observation_id":"4fb11bf9-fcfe-488a-bb6c-46e94179d6f8","resolution":{"observed_at":"2026-08-07T05:01:23.828275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.295723Z","title":"A-vit: Adaptive tokens for efficient vision transformer","venue":null,"work_id":"c39a3047-721d-45ac-819c-4e92716c3f04","year":null},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.831259Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:35c6cce82acf053eae98fbe4897e7d00c7b03ab100941bdb6d97b7487a9f5de7","observation_id":"d5c30b82-a863-4e20-8dfa-befadddf50fa","resolution":{"observed_at":"2026-08-07T05:01:24.299277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.285190Z","title":"Woodscape: A multi-task, multi-camera fisheye dataset for autonomous driving","venue":null,"work_id":"753deb8b-bdd7-437e-98fd-accdfce301c7","year":2019},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.834300Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:3d7a3f3b9290040ccc21a225c2447ed344c1343706270b4bae466b53f579068c","observation_id":"0e845d06-82ed-4ee2-8822-c956a82a55ec","resolution":{"observed_at":"2026-08-07T05:01:24.288980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-07T05:01:23.837602Z","title":"Language model beats diffusion–tokenizer is key to visual generation.arXiv preprint arXiv:2310.05737, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.837602Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:68858b8e854937fee3a79a112b66d40a601ab030050255d9c7039306b63196aa","observation_id":"51258c3e-8c81-49a3-8ae8-791671ac755e","resolution":{"observed_at":"2026-08-07T05:01:23.837602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07550","last_updated":"2024-06-11T17:59:56Z","snapshot_observed_at":"2026-07-06T18:29:08.586253Z","submitted_at":"2024-06-11T17:59:56Z","title":"An Image is Worth 32 Tokens for Reconstruction and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07550","snapshot_observed_at":"2026-08-07T05:01:23.840987Z","title":"An image is worth 32 tokens for reconstruction and generation.arXiv preprint arXiv:2406.07550, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.840987Z"},"links":{"cited_paper":"/paper/2406.07550","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:c6ba16fd3fc722e7ab2f84d9e5a040624259427bc5e475b69b17dbda48831dc5","observation_id":"1406d1ef-0d27-4c18-a42b-e0873baf7cbf","resolution":{"observed_at":"2026-08-07T05:01:23.840987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14289","last_updated":"2023-07-01T07:26:22Z","snapshot_observed_at":"2026-07-06T15:46:29.060519Z","submitted_at":"2023-06-25T16:37:25Z","title":"Faster Segment Anything: Towards Lightweight SAM for Mobile Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14289","snapshot_observed_at":"2026-08-07T05:01:23.844273Z","title":"Faster segment anything: Towards lightweight sam for mo- bile applications.arXiv preprint arXiv:2306.14289, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.844273Z"},"links":{"cited_paper":"/paper/2306.14289","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:67e6bd4d176b930c02bd74ddee5e74cdcd4265ccb7ac5ede6ce3569f83b4e55c","observation_id":"c971f6c8-29c5-4407-8401-1fe63677d38d","resolution":{"observed_at":"2026-08-07T05:01:23.844273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.274785Z","title":"Fine-grained egocentric hand-object segmentation: Dataset, model, and applications","venue":null,"work_id":"f1794e9c-2e66-4328-b082-2dfd600bafd2","year":2022},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.847206Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:a16480b559673e4425dc3b78232cc1e77aff06d064208c489948ea78ac50aaeb","observation_id":"09b06f40-1aee-42b8-9c5a-6f73400cc95c","resolution":{"observed_at":"2026-08-07T05:01:24.278276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.264289Z","title":"Efficientvit-sam: Accelerated segment anything model without performance loss","venue":null,"work_id":"e2590296-a56c-4b37-9d44-b09822d1a779","year":2024},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.850081Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:21e23420a64b1749ad2e7e657b9c2d5f7a38d15511bbb168188f5e2a1c46c77b","observation_id":"13e08c05-b92e-4eb8-a142-e51cfd207e2d","resolution":{"observed_at":"2026-08-07T05:01:24.267838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12156","last_updated":"2023-06-21T10:08:29Z","snapshot_observed_at":"2026-07-06T15:45:01.961896Z","submitted_at":"2023-06-21T10:08:29Z","title":"Fast Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12156","snapshot_observed_at":"2026-08-07T05:01:23.853152Z","title":"Fast segment any- thing.arXiv preprint arXiv:2306.12156, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.853152Z"},"links":{"cited_paper":"/paper/2306.12156","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:6ce9251a290a1b2e77275c9f9e2ef6147e474d6b3974805e74131db96ff4e866","observation_id":"e57b58ee-d1ee-4a3b-bb66-c6f4e81d541b","resolution":{"observed_at":"2026-08-07T05:01:23.853152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.252864Z","title":"Semantic under- standing of scenes through the ade20k dataset.IJCV, 127: 302–321, 2019","venue":null,"work_id":"c263defa-6eb0-4583-b48a-fa8057597724","year":2019},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.856235Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:9927ea5fce24041d8a3e934b868cec43b14498c9afbf49621f31c5928cd70c48","observation_id":"7ce1e0d3-1524-42d2-bd27-260cfd55224e","resolution":{"observed_at":"2026-08-07T05:01:24.256436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06660","last_updated":"2025-09-07T19:09:41Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-11T18:59:52Z","title":"EdgeSAM: Prompt-In-the-Loop Distillation for SAM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06660","snapshot_observed_at":"2026-08-07T05:01:23.859111Z","title":"Edgesam: Prompt-in-the-loop distillation for on-device de- ployment of sam.arXiv preprint arXiv:2312.06660, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.859111Z"},"links":{"cited_paper":"/paper/2312.06660","citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:2e4214baedcba96606afe0a61118f5528ffa488f0b46bd746cf89d6114de8efb","observation_id":"4f101be8-ea3f-41fc-980f-1c44a8ac2330","resolution":{"observed_at":"2026-08-07T05:01:23.859111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.242943Z","title":"MAE Pre-training We pre-trained our foveated image encoders using MAE pre-training for 500K iterations","venue":null,"work_id":"3245eb62-6fc1-4d94-84e4-e4a19a870d74","year":null},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.862624Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:921a37df0adbfef11251d4c8e2bfec74728a1de8d79df826937d985024103a16","observation_id":"9a6763cf-b739-4160-aff5-205b06f3fbe4","resolution":{"observed_at":"2026-08-07T05:01:24.246207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.231369Z","title":"Here we give a more formal definition of the parameterization of such a pattern","venue":null,"work_id":"6821ff0e-6886-46b1-a379-2dbc22e7b8b6","year":null},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.866031Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:cb2a06a032918310eac0d261fc4fecd9b686a0e743084478c39fbb1423995748","observation_id":"ed16bc5d-091d-4f38-bd2f-fd6573629003","resolution":{"observed_at":"2026-08-07T05:01:24.235663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.219049Z","title":"We plot the training loss curves in Figure 12","venue":null,"work_id":"44f8a2fe-c989-4294-bdb5-011afd5f2c92","year":null},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.870145Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:2be31d06796f7a1b75581a207d54b0c75d7dbfd994f06b936532da0d263a9166","observation_id":"47069a74-dd08-4d4f-8a35-60ad7cff6bd0","resolution":{"observed_at":"2026-08-07T05:01:24.223472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.207989Z","title":"Our foveation patterns exists in a high-dimensional design space, and each new pattern requires its own MAE pre-training","venue":null,"work_id":"2d972c2a-17ab-47a8-97d6-c1bdbf487fc1","year":null},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.873570Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:cad815dca3b800cbd2874d5aca0febe2f359d3b7a15e01885b12455c86a4b01e","observation_id":"e45f3356-3b77-40e8-bd38-290c2a6498fd","resolution":{"observed_at":"2026-08-07T05:01:24.211826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.197070Z","title":null,"venue":null,"work_id":"71ef1a68-72c8-4132-9b21-3536f785e580","year":null},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.876636Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:fc710f9d07161f312c1426c3ac3bd8be6b45d996120d22a2a684e209933c7fb8","observation_id":"813448ba-c64e-4019-a5c7-c23e2205b705","resolution":{"observed_at":"2026-08-07T05:01:24.200458Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.186869Z","title":null,"venue":null,"work_id":"7eb9fdf4-01aa-46be-8738-9db04f5065c9","year":null},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.879791Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:cc58460e00655c82b983bbeb9736a891e8701bd2a53c29ef7c6428280b922aca","observation_id":"399a220f-faf9-4e66-be1f-94a640639ef8","resolution":{"observed_at":"2026-08-07T05:01:24.190238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:01:24.174287Z","title":"in computing FLOP counts for transformer architectures (c.f","venue":null,"work_id":"d9ce741e-7d9a-438c-83e5-2ee68d5b8c72","year":null},"citing_paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:23.882872Z"},"links":{"citing_paper":"/paper/2506.11131"},"observation_digest":"sha256:ad979e0fc8fa841578f6b743979612bf2eec0b0ae8f13939453d3ee18030b659","observation_id":"51feced0-379a-438d-ba46-36a366146a89","resolution":{"observed_at":"2026-08-07T05:01:24.179128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.11131","last_updated":"2025-06-10T18:06:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T04:53:44.298480Z","submitted_at":"2025-06-10T18:06:27Z","title":"Segment This Thing: Foveated Tokenization for Efficient Point-Prompted Segmentation"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":31},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2506.11131."}