{"as_of":"2026-08-10T17:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ad6c0770c09a7c53d0bd79b84bb6720edad18fa890fb21cd9f301b836cdf2f26","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:19:23.191967Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T00:18:06.989944Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T00:19:46.820702Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"cited_work":{"arxiv_id":"2502.02763","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02763","snapshot_observed_at":"2026-07-13T01:17:40.500289Z","title":"arXiv preprint arXiv:2502.02763 (2025)","venue":null,"work_id":"48021262-0742-46fa-b7fa-7f733978fe3a","year":2025},"citing_paper":{"arxiv_id":"2604.20392","last_updated":"2026-04-22T09:53:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-22T09:53:28Z","title":"Self-supervised pretraining for an iterative image size agnostic vision transformer","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T00:18:06.989944Z"},"links":{"cited_paper":"/paper/2502.02763","citing_paper":"/paper/2604.20392"},"observation_digest":"sha256:e3fe5ac6d0203882d641054ea53018665c84290a25edcea2ef06a939d665f8b3","observation_id":"be67138d-9cdd-4c25-973e-ac8abc8f5a1d","resolution":{"observed_at":"2026-07-13T01:17:40.500289Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.02763/citation-record","integrity":"/paper/2502.02763/integrity","json":"/paper/2502.02763/citation-record.json","paper":"/paper/2502.02763"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:19:23.527658Z","title":"Focal sparse convolutional networks for 3d object detection","venue":null,"work_id":"fe8fa3c4-364b-456a-bd0a-0f73cfed0e9d","year":2022},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.079589Z"},"links":{"citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:51cc2663d59d151885ce9231d752ad078f1bb453b712f214592f6e06da090232","observation_id":"aef2c08a-e2ef-4762-bcaf-da5d24a04762","resolution":{"observed_at":"2026-08-09T11:19:23.532068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:19:23.512511Z","title":"Deformable convolutional networks","venue":null,"work_id":"6a764ef5-5828-41e2-a582-c223693b003d","year":2017},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.084083Z"},"links":{"citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:901eb3018be805ca2306d2cde0ae5ca7ab29b0550883019b1c4fe9a94a28b3e9","observation_id":"6b9a0d16-b217-4c80-a1e9-e18b7178aeaf","resolution":{"observed_at":"2026-08-09T11:19:23.516609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:19:23.502204Z","title":"Objaverse: A universe of annotated 3d objects","venue":null,"work_id":"a95051e5-4424-469a-bcc6-39d547d7d204","year":2023},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.088072Z"},"links":{"citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:09537751ae118ff383f6d9df2aadc6bd1d3698f3b45559a6660b8e70f1795e0f","observation_id":"e692c0da-2b99-498e-ab61-ddf0e784fd93","resolution":{"observed_at":"2026-08-09T11:19:23.505803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-09T11:19:23.091877Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.091877Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:8ca1e5a0da841bd19a9e34841532f262eea01d86af5066d4f5fa170bcc5eec9e","observation_id":"5a218b3b-ef72-4de6-a4a2-0ea29ab5a7e2","resolution":{"observed_at":"2026-08-09T11:19:23.091877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:19:23.490796Z","title":"C., and Kipf, T","venue":null,"work_id":"25be576c-fb1a-4eaa-bc98-b4ad6040b6a8","year":2022},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.096191Z"},"links":{"citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:073da5a7da52c7fa2b6392aa7cde98a6f9fad39319933112e7ffe2cc47744d0b","observation_id":"ed9c03ac-82bf-4c07-8931-eda19d4fd0ee","resolution":{"observed_at":"2026-08-09T11:19:23.494268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:19:23.099713Z","title":"Lvis: A dataset for large vocabulary instance segmentation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.099713Z"},"links":{"citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:ccc3d47f758c40bb9f2a3c2af4c39c8761565dfa00f5d27c6ad36a32ab1cba8c","observation_id":"e355b5a9-61dc-4867-bed8-e3bc0e20e8dd","resolution":{"observed_at":"2026-08-09T11:19:23.099713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14795","last_updated":"2022-03-15T22:37:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-30T17:53:34Z","title":"Perceiver IO: A General Architecture for Structured Inputs & Outputs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.14795","snapshot_observed_at":"2026-08-09T11:19:23.103509Z","title":"Perceiver io: A general architecture for structured inputs & outputs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.103509Z"},"links":{"cited_paper":"/paper/2107.14795","citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:fd069d079b4c0a905ba45ee6b1f6d35f0afbd43a369f3973e768562e7e7af42c","observation_id":"63c4ade8-74ca-41fa-acb4-3271184e0ee0","resolution":{"observed_at":"2026-08-09T11:19:23.103509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:19:23.473232Z","title":"S., Sochenov, A., Leimk \\\"u hler, T., Okunev, M., Goodall, T., and Rufo, G","venue":null,"work_id":"e6240127-39dd-4d2a-8ee1-1b7363dfec8e","year":2019},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.106998Z"},"links":{"citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:312e8194de6423e4ccaf1571c9eae81f5ef57d4ddcfaf2e6e6fb41a33556ad71","observation_id":"d6085e78-f0da-42b2-80e4-1bc5be682996","resolution":{"observed_at":"2026-08-09T11:19:23.477171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:19:23.110318Z","title":"C., Lo, W.-Y., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.110318Z"},"links":{"citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:0294191205a654062a2da76a56fedebb4d86741b96d2f255de8e45b36373b277","observation_id":"348ee7a9-8c1f-46a1-baf1-ac6afdd9af4c","resolution":{"observed_at":"2026-08-09T11:19:23.110318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:19:23.113657Z","title":"The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale","venue":null,"work_id":null,"year":1956},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.113657Z"},"links":{"citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:d2243026b75c7e84734cf5439651e91658a055c314d22df7b6f66a85d35b2b2f","observation_id":"2727d70f-9aa7-45b2-9a47-13d1e7b60a63","resolution":{"observed_at":"2026-08-09T11:19:23.113657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:19:23.449527Z","title":"Kitti-360: A novel dataset and benchmarks for urban scene understanding in 2d and 3d","venue":null,"work_id":"37847919-f7a7-49b7-83dd-5b1bd5c4c835","year":2022},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.117269Z"},"links":{"citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:f24d589db5a4ddbccfb0394e8e95fa260226f73d7c0fcb5f878b2968d5ab2f5f","observation_id":"61d094aa-1c0b-476c-a91f-1cb4287a185e","resolution":{"observed_at":"2026-08-09T11:19:23.453297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:19:23.120823Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.120823Z"},"links":{"citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:0da14d1ccad658d19f786b0b74b0f8cf4f059cdcf70e46240698912c8919d329","observation_id":"dfcf102c-27e3-47a9-b365-35c904a1c5fe","resolution":{"observed_at":"2026-08-09T11:19:23.120823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:19:23.124894Z","title":"A convnet for the 2020s","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.124894Z"},"links":{"citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:1bf64d9f7ca1c4bf71a005db0268cbf719933d4fca82f1c51905bb62339e9fe8","observation_id":"ecbb7336-e589-441a-8320-b7a771ff23a5","resolution":{"observed_at":"2026-08-09T11:19:23.124894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:19:23.128418Z","title":"Object-centric learning with slot attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.128418Z"},"links":{"citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:64272f860e5f01ff3c493a01582550e7e13d8d3bb0df881d686f61a15faf7f43","observation_id":"4761056f-94e7-4bdf-86a2-2f0bac12a388","resolution":{"observed_at":"2026-08-09T11:19:23.128418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:19:23.419935Z","title":"Biologically inspired deep learning model for efficient foveal-peripheral vision","venue":null,"work_id":"41879382-7cb5-4fc7-a6ad-a2698ec2602c","year":2021},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.132289Z"},"links":{"citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:4e8af0ff71e0e678ba4de972c314316a92e310c6b5b3b59c371963e215d996c4","observation_id":"fa0d062a-7b94-4f7a-95b8-f599a6995fef","resolution":{"observed_at":"2026-08-09T11:19:23.423820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:19:23.408955Z","title":"A., Paczan, N., Webb, R., and Susskind, J","venue":null,"work_id":"ed468da7-47dc-43d1-95ca-2061c824eeee","year":2021},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.136215Z"},"links":{"citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:ea9e8056d84a93a49a6c8abde64db0bf891b17182581779f63b29cd14f8e095f","observation_id":"39862b7b-c7af-4362-bf18-b8b4f76699e2","resolution":{"observed_at":"2026-08-09T11:19:23.412652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:19:23.396927Z","title":"Simple unsupervised object-centric learning for complex and naturalistic videos","venue":null,"work_id":"47ad9b17-1c85-422a-8cc1-c0bccf9e7a37","year":2022},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.140120Z"},"links":{"citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:eac16f15b2135c2b26fe611bbb0e6bf4d0b500bf5ab19e8f04b223e438e6067f","observation_id":"3de9cd10-298a-4932-87b4-247187451080","resolution":{"observed_at":"2026-08-09T11:19:23.401449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:19:23.385780Z","title":"Fovea: Foveated image magnification for autonomous navigation","venue":null,"work_id":"ad349dd5-4f68-4799-b514-e84ec46c2592","year":2021},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.143775Z"},"links":{"citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:d0b9afa9865268ab704a6be533196c13689e49bf18292ec487c07b5ecc756eb9","observation_id":"f73b75ad-9853-491b-b4fb-24f6c98c6f8b","resolution":{"observed_at":"2026-08-09T11:19:23.389788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:19:23.374218Z","title":null,"venue":null,"work_id":"cc1bf514-14ba-4b77-9681-2eaf498f7717","year":2023},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.147186Z"},"links":{"citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:3c35e2968f7543ada0fb70a668f6a05b5739a4ee9f0bf51e4c6375568715dee2","observation_id":"5ebfc136-c11f-4d3a-8233-7baeeafc4e15","resolution":{"observed_at":"2026-08-09T11:19:23.378406Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:19:23.362846Z","title":null,"venue":null,"work_id":"9d402e5d-8810-439b-b306-8eea56e5aef7","year":2024},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.150628Z"},"links":{"citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:ce21bae83d872871cda3a7f029ed133a7ff9b403ee14cfe661e7bc918fecfc78","observation_id":"ad15cafb-baf6-44eb-a9fa-b5ec089c81c3","resolution":{"observed_at":"2026-08-09T11:19:23.366867Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:19:23.351108Z","title":null,"venue":null,"work_id":"46bd50eb-aa2f-44b8-b6e0-fb8dacbb675a","year":2024},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.154164Z"},"links":{"citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:d93a28779c05246810e44beb717788ea319fe760700726de83a167d60f4a0889","observation_id":"11f94f2c-7b34-40ac-829c-2a84283a96fc","resolution":{"observed_at":"2026-08-09T11:19:23.355602Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:19:23.340824Z","title":"Tinyvit: Fast pretraining distillation for small vision transformers","venue":null,"work_id":"3398e1d4-2813-45ae-9146-dfff1370154c","year":2022},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.157736Z"},"links":{"citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:9877acd60c8b6c8d08d866903184d4a8a128abe21c57f6dd7ee89381b0d6c360","observation_id":"de4422ff-b813-4f9b-8bd6-1d03b448c22e","resolution":{"observed_at":"2026-08-09T11:19:23.344416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00863","last_updated":"2023-12-01T18:31:00Z","snapshot_observed_at":"2026-07-06T16:55:49.813116Z","submitted_at":"2023-12-01T18:31:00Z","title":"EfficientSAM: Leveraged Masked Image Pretraining for Efficient Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00863","snapshot_observed_at":"2026-08-09T11:19:23.161236Z","title":"Efficientsam: Leveraged masked image pretraining for efficient segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.161236Z"},"links":{"cited_paper":"/paper/2312.00863","citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:4f41ef743c63af932500b1647fb1167af331fcb326d1d17991d037108ba85b39","observation_id":"b1807004-4610-4e87-9e7d-d8620f8f41f1","resolution":{"observed_at":"2026-08-09T11:19:23.161236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:19:23.329532Z","title":"Efficient deformable convnets: Rethinking dynamic and sparse operator for vision applications","venue":null,"work_id":"b4f53732-d2bc-4180-b99a-362135b29d82","year":2024},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.165209Z"},"links":{"citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:d3a758219915700b4bc6bb81e004fb7d8daea6f9d48120c557781223eaf78dc2","observation_id":"5022d81f-a49d-4d69-bf07-c58193a110cc","resolution":{"observed_at":"2026-08-09T11:19:23.333517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:19:23.317094Z","title":"Lape: Layer-adaptive position embedding for vision transformers with independent layer normalization","venue":null,"work_id":"9afb25d9-45f1-4ea9-8469-1112e7f2ff8b","year":2023},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.168897Z"},"links":{"citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:9e050af1bea31fd94f3dea6c81742194a1023daddbd7ad70c63791ef3b08e571","observation_id":"1283680c-c063-4688-ac1a-a4cec288a2b4","resolution":{"observed_at":"2026-08-09T11:19:23.321516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:19:23.305494Z","title":"Hdri haven, 2016","venue":null,"work_id":"25120ba8-bae7-4692-99c1-2e0365f98c04","year":2016},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.172336Z"},"links":{"citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:908ca833499a0859855aeb370178ac45662a90a307701c4bf2a1aa14c3f8853b","observation_id":"572d0087-8a8b-49e8-9367-5a618df5a46b","resolution":{"observed_at":"2026-08-09T11:19:23.309605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:19:23.293953Z","title":"Object-centric learning for real-world videos by predicting temporal feature similarities","venue":null,"work_id":"ccc4bb1d-7c58-41f4-a3fc-4f08dfb19941","year":2024},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.176069Z"},"links":{"citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:987457444b4dcf63a2d7b4a7fc9bce552d533b7a78bc1147b8da1d5e784468a6","observation_id":"3526f2cc-6731-4960-a531-8761ca17a5f1","resolution":{"observed_at":"2026-08-09T11:19:23.297696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14289","last_updated":"2023-07-01T07:26:22Z","snapshot_observed_at":"2026-08-08T16:17:33.420400Z","submitted_at":"2023-06-25T16:37:25Z","title":"Faster Segment Anything: Towards Lightweight SAM for Mobile Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14289","snapshot_observed_at":"2026-08-09T11:19:23.179663Z","title":"U., Bae, S.-H., Lee, S., and Hong, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.179663Z"},"links":{"cited_paper":"/paper/2306.14289","citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:1f37029a850db6d1fe410ae2b0f3a11ca4e7bdaaf1e10d48e69f01c39489e51b","observation_id":"456ce933-29a1-431c-87ba-1339b93fbc60","resolution":{"observed_at":"2026-08-09T11:19:23.179663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:19:23.282987Z","title":"Fast segment anything, 2023","venue":null,"work_id":"45d5fac3-fca7-4781-aa6d-79bf8f8f8277","year":2023},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.183512Z"},"links":{"citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:2f604b8a5e2e15fd603f2934c26583b8003f3dd74c9e70ca3141cbca93236119","observation_id":"ecee854f-05e6-4dcc-8e8e-7774c690e1d5","resolution":{"observed_at":"2026-08-09T11:19:23.286527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:19:23.269896Z","title":"Deformable convnets v2: More deformable, better results","venue":null,"work_id":"b18da389-c6d5-409d-9975-e81f390b5929","year":2019},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.188345Z"},"links":{"citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:57fea19dba2d618d508298b248672f1ab30f051e706ec0642292bc60ac23f014","observation_id":"698f2ba0-d7ed-4fcd-9f6d-e244b795f22b","resolution":{"observed_at":"2026-08-09T11:19:23.275476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T11:19:23.191967Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T11:19:23.191967Z"},"links":{"citing_paper":"/paper/2502.02763"},"observation_digest":"sha256:d52009695e6cf2521484a11a44441a688fddb851d577def8df9dfc7b02cf4e27","observation_id":"a8a9c764-eca2-407d-87bc-0a74a9bf7549","resolution":{"observed_at":"2026-08-09T11:19:23.191967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.02763","last_updated":"2026-07-10T10:26:20Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T11:10:26.898896Z","submitted_at":"2025-02-04T23:07:34Z","title":"Looking Locally: Object-Centric Vision Transformers as Foundation Models for Efficient Segmentation"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 1 inbound Pith citation observation for arXiv:2502.02763."}