{"as_of":"2026-08-08T21:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f8bbfe0dab6bb61216823aeb2591cada2047ea4ab361d458f22452c0be43ac8f","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T10:16:59.222616Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.09660/citation-record","integrity":"/paper/2502.09660/integrity","json":"/paper/2502.09660/citation-record.json","paper":"/paper/2502.09660"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-08T10:16:59.004858Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.004858Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:f7ffcecff9ca3f91c23fb6d95942c9593d3e18e99f2d0663b3cf24f7cbf53d4f","observation_id":"a58a2399-cda4-460f-8930-ab44c02f8baa","resolution":{"observed_at":"2026-08-08T10:16:59.004858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.920784Z","title":"Per-pixel classification is not all you need for semantic segmentation","venue":null,"work_id":"f0689772-79f3-4e3b-9e4b-29b7906a4820","year":2021},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.011031Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:ed0d7cc2eeab3e75c8da89b33c88fb33c100dac0853cd8f02e9fa683435c92e9","observation_id":"a32f7675-49bf-48ea-be49-2505cefe187c","resolution":{"observed_at":"2026-08-08T10:16:59.925798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.905954Z","title":null,"venue":null,"work_id":"b4db7ddd-e9e3-4efc-994a-654deb4d1e4d","year":2022},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.015816Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:223fa9e0392ca10097db00a102f637f0de7314799fd3e8813dc21179ff00294a","observation_id":"479e092a-5c98-4226-8cfd-dd0ed8a65117","resolution":{"observed_at":"2026-08-08T10:16:59.910485Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.891154Z","title":"Xmem: Long- term video object segmentation with an atkinson-shiffrin memory model","venue":null,"work_id":"21728906-b519-4dcc-8684-5f0e891cdaea","year":2022},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.020807Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:e0b8a1a435446433895d220b103c068801eea9cf873f9668a68e8a2f3a577d3f","observation_id":"a625fdcf-24ad-4887-bb94-c726b31caa18","resolution":{"observed_at":"2026-08-08T10:16:59.895999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.875979Z","title":"CascadePSP: Toward class-agnostic and very high- resolution segmentation via global and local refinement","venue":null,"work_id":"48acec1a-18b0-4059-925f-4f0d5b446bed","year":2020},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.026480Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:30ff502683527f969ca0e4f1fe35698f1c89107248b0a18f87a6b9e7e3acce27","observation_id":"adb37cc1-5c12-426d-bb54-06384bcec244","resolution":{"observed_at":"2026-08-08T10:16:59.880723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.860747Z","title":"Schwing Alexander Kirillov Cheng, Bowen and Rohit Girdhar","venue":null,"work_id":"eb94a67b-9fcd-4204-b3d0-0c33320c2670","year":2022},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.031079Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:d32d3439975413c9663234b65f8fc2ee6fb13805cfad1fabf34c5778a46a29f0","observation_id":"3f19c9e9-6c00-4062-80e5-17221714b97f","resolution":{"observed_at":"2026-08-08T10:16:59.865618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.845548Z","title":"Collins Yukun Zhu Ting Liu Thomas S","venue":null,"work_id":"e0bbc423-3209-4c37-8692-288a206bf297","year":2020},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.036295Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:299fb98d3443c4c320813cbcc1d1776f109ad709a8b1158641b29816d2f537a7","observation_id":"b06ef80c-a69a-4be5-99fd-6b1720d52cb6","resolution":{"observed_at":"2026-08-08T10:16:59.850402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.829638Z","title":"Global contrast based salient region detection","venue":null,"work_id":"a2ef46b4-77d9-4502-993c-4fb7b624c280","year":2014},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.040899Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:b7be7da101c88c1246f28334541302bae70e69a20f61aec8985411776457c464","observation_id":"ba736375-d047-4514-8f61-c7b85c935669","resolution":{"observed_at":"2026-08-08T10:16:59.835145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.814197Z","title":"Instance-aware se- mantic segmentation via multi-task network cascades","venue":null,"work_id":"fadd9096-de05-4f10-8df8-f54d0cd8a587","year":2016},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.045465Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:61e27d564b2a5ca6427e9fd11ba9affa04c5082054e2650795a9fdd4273a8c27","observation_id":"c15364fd-d8ac-4ca6-b1a1-ec9db101a14a","resolution":{"observed_at":"2026-08-08T10:16:59.818916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.799692Z","title":"Seg- ment and recognize anything at any granularity","venue":null,"work_id":"18272e70-3c79-4884-8756-d3040b2b76d2","year":2024},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.050169Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:ce38e952ace195ea4e3c2d8984e5c8f48f0228d5b37b7c8ca1873b388edc59d2","observation_id":"93fd1ef5-0eb8-4c9c-8f4e-020db3ba7ea7","resolution":{"observed_at":"2026-08-08T10:16:59.804294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.784797Z","title":"Lvis: A dataset for large vocabulary instance segmentation","venue":null,"work_id":"e16b7b0a-bdbf-4b2b-abb1-ee5a1addf7f5","year":2019},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.054725Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:f2c74ff80d0cc5aeb701d3f21dd2c9a2fb88114e841680307d37966b487ea0b5","observation_id":"ac2f5d83-0580-4c95-bcba-1d30d6345cb8","resolution":{"observed_at":"2026-08-08T10:16:59.789685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.769770Z","title":"Mask r-cnn","venue":null,"work_id":"8e5734e5-8eb5-4b4a-9188-8f4b9f5f285b","year":2017},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.059374Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:5d382c2c8ab5760d91b8de617fc9ff37d1f4261908a0eb3975c967809dad4a80","observation_id":"c9a2b46c-ac18-4f16-be57-d06b8df508c0","resolution":{"observed_at":"2026-08-08T10:16:59.774429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.754417Z","title":"Rethink- ing space-time networks with improved memory coverage for efficient video object segmentation","venue":null,"work_id":"6cadb7de-08a6-4b4f-bdcb-ce4f42ee4eb6","year":2021},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.064060Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:803ea8d504564cdef04da7e85e09b640cd99aa23ffe4b378ee6c2dc1d12b4300","observation_id":"61314d26-c4e3-4a5e-aa07-745b5392b1a8","resolution":{"observed_at":"2026-08-08T10:16:59.759442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.068505Z","title":"Panoptic segmentation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.068505Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:734a71a36eddecbbd17790496f3136c1ab03016047ba3f9d0fda0caf1b0e94cf","observation_id":"b070dc0d-5c1c-457b-b0dd-f8c707ef5a53","resolution":{"observed_at":"2026-08-08T10:16:59.068505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.727658Z","title":"Berg, Wan-Yen Lo, Piotr Dollár, and Ross Girshick","venue":null,"work_id":"33432ed9-cf05-4dde-9599-fe947147a6ee","year":2023},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.072930Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:a0008b594147bc6b6804c79fe9a9ce286086a0801b1e85ca4bd1fd843dad99ee","observation_id":"db586eca-b7aa-4a30-aa0a-cc4ae127b4c0","resolution":{"observed_at":"2026-08-08T10:16:59.732802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.711307Z","title":"Segment anything in high quality","venue":null,"work_id":"98d15a95-7dbd-451c-b745-de706eb5ead1","year":2023},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.077306Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:34fe355244d961312c2b34a29bede25033a60416bcd9110e42c7c38c3e8792ff","observation_id":"06cac80c-b8d1-406c-bd1e-5288f5bdf872","resolution":{"observed_at":"2026-08-08T10:16:59.716343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.696026Z","title":"Fss-1000: A 1000-class dataset for few- shot segmentation","venue":null,"work_id":"28ecbb34-1433-46d5-92d3-7a9d59c80aff","year":2020},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.081856Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:d7fbf740711e180b13d93e070e4a45f2f608b8a45a0b50e9b514876ee8879c5c","observation_id":"8b8f689c-b8ff-418f-80d9-c93fb077ae00","resolution":{"observed_at":"2026-08-08T10:16:59.700899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05587","last_updated":"2017-12-05T18:06:21Z","snapshot_observed_at":"2026-08-07T13:44:53.690521Z","submitted_at":"2017-06-17T22:48:57Z","title":"Rethinking Atrous Convolution for Semantic Image Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05587","snapshot_observed_at":"2026-08-08T10:16:59.086439Z","title":"Rethinking atrous convolution for semantic image segmentation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.086439Z"},"links":{"cited_paper":"/paper/1706.05587","citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:c0bd787a68f3d490b988f74cbdd4ff42e6e5225a57f7420d3e5a14b1e7727758","observation_id":"ab11bf46-4feb-424b-ab11-cf251444ca2a","resolution":{"observed_at":"2026-08-08T10:16:59.086439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.681025Z","title":"Deep interactive thin object selection","venue":null,"work_id":"91d6311b-5cfc-4ff3-84a2-be1c24b9aa88","year":2021},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.091150Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:ab087ad65091cddfbe03ccae8465deddf9393096108e75abfc27d6a9fd812427","observation_id":"1fc20d64-650b-41e2-8345-aacb4f51dd24","resolution":{"observed_at":"2026-08-08T10:16:59.685948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.665930Z","title":"Segment anything with precise interaction","venue":null,"work_id":"53bcf11f-3ce5-4412-a1e7-3d2a6174245f","year":2024},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.095546Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:8e8985cd1a6d10dce79380ff2f355af401c398f225bc53cda8408fbcbb17b451","observation_id":"00698961-8a1a-4e75-a6df-83c232d9dffc","resolution":{"observed_at":"2026-08-08T10:16:59.670729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.652006Z","title":"Receptive field block net for accurate and fast object detection","venue":null,"work_id":"12bf287e-a156-49b1-a4bd-df307a127e94","year":2018},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.100231Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:acdc3add8fb2426d71cee64ea09a7de4f35342d713eb5da5f43fdf8d2ae49000","observation_id":"5966737f-cbd8-4baa-85fe-98736c4cf77c","resolution":{"observed_at":"2026-08-08T10:16:59.656542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.104585Z","title":"Fully convolutional networks for semantic segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.104585Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:96059275153bc352a14e016cb42ab8d24d7eadc966a799d33d4b9e8b0965d4d8","observation_id":"771023ec-81f7-416c-9b1e-e877d8f5d5ae","resolution":{"observed_at":"2026-08-08T10:16:59.104585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.108941Z","title":"Segment anything in medical images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.108941Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:21960161dc258bfc1073a6ceb27ea318a461c0fa82f694df70b7e7655c685942","observation_id":"526b13bf-2f70-4049-85f6-b2cdbcfd32dd","resolution":{"observed_at":"2026-08-08T10:16:59.108941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.617521Z","title":"Gaus- sian grouping: Segment and edit anything in 3d scenes","venue":null,"work_id":"0ff100b9-1a9f-4249-a623-e58e7603fd90","year":2024},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.114203Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:ec2ba19fca38b89211b142a554ff5d83e2ae4850bbae8dbb2feb0029390dd3a8","observation_id":"6b3d4c92-06d6-4026-a5af-7ec1215da5b2","resolution":{"observed_at":"2026-08-08T10:16:59.622584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.603082Z","title":"Recurrent dynamic embedding for video object segmentation","venue":null,"work_id":"14c41579-6d5a-4a99-a36d-a30de329f89e","year":2022},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.118776Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:ee39308497d6a83b8eb469700fa46a6ccc2b733606866dc4fd9313ba7bb5d28f","observation_id":"a4f6d3b3-7b04-42d4-8717-f1056b123f0d","resolution":{"observed_at":"2026-08-08T10:16:59.607832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.588675Z","title":"Highly accurate dichotomous im- age segmentation","venue":null,"work_id":"b8e64362-10e9-45b4-b499-76222d1bad6e","year":2022},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.123407Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:8f6e48de50ba6142407f66825929dde15075e3a14f5ac9f91620bcc14a48f680","observation_id":"3ac1ec4e-2c44-4da4-a3bb-fdfb5bd69fab","resolution":{"observed_at":"2026-08-08T10:16:59.593340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.574082Z","title":"Learning dynamic convolutions for multi-modal 3d mri brain tumor segmentation","venue":null,"work_id":"42582dee-bba4-47d8-aea2-5ef3d214b264","year":2020},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.127847Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:3cdfe6cc649c26b759431fe672177cc5090d82a50f2c948151558b90495f4384","observation_id":"ed8a5d5c-db66-4091-b9d5-091e8221d5ca","resolution":{"observed_at":"2026-08-08T10:16:59.578848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-08T10:16:59.138379Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.138379Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:56902ac57ca25d77664f9ae235d8ee3701edbdf13e1aa3532d3c65e665293d2e","observation_id":"1d187f0e-dc79-4dd0-ae4c-85d26ac450b4","resolution":{"observed_at":"2026-08-08T10:16:59.138379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.559108Z","title":"Hi- era: A hierarchical vision transformer without the bells-and- whistles","venue":null,"work_id":"7cf2ba72-4b02-4b76-b9b4-dd8fae379a83","year":2023},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.143696Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:e12f95152542524c39c3a6c971e216c3425e930fe99237d55ddde7af654528e4","observation_id":"2f5e8bd8-699d-4adf-82ef-911d9c0c9c7e","resolution":{"observed_at":"2026-08-08T10:16:59.563735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10261","last_updated":"2023-04-19T16:39:51Z","snapshot_observed_at":"2026-08-04T21:24:21.644542Z","submitted_at":"2023-04-19T16:39:51Z","title":"Anything-3D: Towards Single-view Anything Reconstruction in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10261","snapshot_observed_at":"2026-08-08T10:16:59.148568Z","title":"Anything- 3d: Towards single-view anything reconstruction in the wild","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.148568Z"},"links":{"cited_paper":"/paper/2304.10261","citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:34463fe3088fd882cd49ea30e449acba0e717aec23b86ff15118f090bd67ea71","observation_id":"2963cc28-4e65-4378-a6b6-74a539a72178","resolution":{"observed_at":"2026-08-08T10:16:59.148568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.544639Z","title":"Hierarchical image saliency detection on extended cssd","venue":null,"work_id":"22d7c0ac-0bf3-4048-bfec-5d716cdae71c","year":2015},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.153510Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:25b559a96da0e0b507ac2a15a57c77aeb8b24aefdebf262ce0e729f9ee70fd68","observation_id":"ed74f668-cf70-4714-ae81-2497ed6c1b72","resolution":{"observed_at":"2026-08-08T10:16:59.549339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12425","last_updated":"2023-12-19T18:53:47Z","snapshot_observed_at":"2026-08-07T23:31:18.216624Z","submitted_at":"2023-12-19T18:53:47Z","title":"SegRefiner: Towards Model-Agnostic Segmentation Refinement with Discrete Diffusion Process","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12425","snapshot_observed_at":"2026-08-08T10:16:59.157871Z","title":"Segrefiner: Towards model- agnostic segmentation refinement with discrete diffusion process","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.157871Z"},"links":{"cited_paper":"/paper/2312.12425","citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:e10f70ae8563af9c3cf35c5f1f431e406118a0bde0f6b95d7b485866ab793b26","observation_id":"5bcc1b51-d77b-499c-9c2a-b56182ce3621","resolution":{"observed_at":"2026-08-08T10:16:59.157871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.530234Z","title":null,"venue":null,"work_id":"661d7f9d-cf13-422a-b4bc-3eeeceafd077","year":2020},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.162792Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:c98e7e4e4d594127c45d2914fd8223039056a7a5a4f56da8125a7d926c6bf111","observation_id":"c8612123-b0b0-4c49-bc43-b6e8a3bdb295","resolution":{"observed_at":"2026-08-08T10:16:59.534776Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03284","last_updated":"2023-04-06T17:59:57Z","snapshot_observed_at":"2026-08-06T11:42:00.456001Z","submitted_at":"2023-04-06T17:59:57Z","title":"SegGPT: Segmenting Everything In Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03284","snapshot_observed_at":"2026-08-08T10:16:59.167280Z","title":"Seggpt: Segmenting ev- erything in context","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.167280Z"},"links":{"cited_paper":"/paper/2304.03284","citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:2936ef4d8d412e37208452c5c8cd958e469bcad32da1de5b21e749440f399024","observation_id":"064aadbb-d1fc-4fa6-bfa5-c65e6f5c8159","resolution":{"observed_at":"2026-08-08T10:16:59.167280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12620","last_updated":"2023-12-29T03:40:59Z","snapshot_observed_at":"2026-07-06T15:19:39.223171Z","submitted_at":"2023-04-25T07:34:22Z","title":"Medical SAM Adapter: Adapting Segment Anything Model for Medical Image Segmentation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12620","snapshot_observed_at":"2026-08-08T10:16:59.172197Z","title":"Medical sam adapter: Adapting seg- ment anything model for medical image segmentation.arXiv preprint arXiv:2304.12620, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.172197Z"},"links":{"cited_paper":"/paper/2304.12620","citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:3099db23c92eb6dc877e1c9a104fea5cabfe66dae803bf1123d1deb5d0200ba8","observation_id":"df79e754-b358-4446-9f10-6f867a677fa7","resolution":{"observed_at":"2026-08-08T10:16:59.172197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14006","last_updated":"2023-04-27T07:57:38Z","snapshot_observed_at":"2026-07-06T15:20:37.222868Z","submitted_at":"2023-04-27T07:57:38Z","title":"Edit Everything: A Text-Guided Generative System for Images Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14006","snapshot_observed_at":"2026-08-08T10:16:59.177313Z","title":"Edit every- thing: A text-guided generative system for images editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.177313Z"},"links":{"cited_paper":"/paper/2304.14006","citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:76959f53aa56e75e4f84ec75fe41f4e669d350c92d412bc99fe152cf06673365","observation_id":"9537121a-16c2-4b40-97af-8c4eb9abd83c","resolution":{"observed_at":"2026-08-08T10:16:59.177313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.514421Z","title":"Al- varez Xie, Enze and Ping Luo","venue":null,"work_id":"f10502db-27f2-4eb7-8c7d-6f043425c55a","year":2021},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.181981Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:0694f73cab37e589a545ced203a67f4e5ce7fbf1043a8cb0658c0545c0faecd7","observation_id":"9dd8c4ff-974b-4cf0-9b75-dd6ab96431cd","resolution":{"observed_at":"2026-08-08T10:16:59.519028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11811","last_updated":"2025-02-12T05:16:17Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:57:06Z","title":"EmbodiedSAM: Online Segment Any 3D Thing in Real Time","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11811","snapshot_observed_at":"2026-08-08T10:16:59.186201Z","title":"Embodiedsam: Online segment any 3d thing in real time","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.186201Z"},"links":{"cited_paper":"/paper/2408.11811","citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:5ccd43847d9c6061aa69fc55ff8fc10f0be4b0db62bed6fba22c2e749574eb5d","observation_id":"9d884c20-b936-46d8-b45e-0f27a2c2ab21","resolution":{"observed_at":"2026-08-08T10:16:59.186201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.498526Z","title":"Seg- ment everything everywhere all at once","venue":null,"work_id":"980f27e0-ef96-43ed-9b5d-74346bbdbbb9","year":2023},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.190848Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:46e75a51975688c31c82dab3a535f61fb6afcfeeb75e10701f616e7f1dde2a49","observation_id":"19655146-7fab-4feb-94f2-f5babd7c3b66","resolution":{"observed_at":"2026-08-08T10:16:59.503984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.482613Z","title":"Saliency detection via graph-based man- ifold ranking","venue":null,"work_id":"a2c16c2f-c3e2-41b6-8a8b-a25c31dbeb14","year":2013},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.195344Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:36a5bad6313214f459318857c6a45d357a46b18110c4de1fbb8d1e5faf42f1dc","observation_id":"e1ddc00c-fd76-4df8-b7ba-381cddafff3b","resolution":{"observed_at":"2026-08-08T10:16:59.487569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.467860Z","title":"Decoupling features in hi- erarchical propagation for video object segmentation","venue":null,"work_id":"40d0e521-8d6e-4318-9d79-1444395f57ca","year":2022},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.199856Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:d69102a47d285383fef60f8ea476a3f02d43cc717a98149ee42966f4e80ccddf","observation_id":"2cb4b2d7-a7e0-4d0e-9800-f04c949f6528","resolution":{"observed_at":"2026-08-08T10:16:59.472551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.452750Z","title":"Multi-view aggregation network for dichoto- mous image segmentation","venue":null,"work_id":"ec03a4b3-f37e-46d9-8823-7b4aa4c09301","year":2024},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.204599Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:8463928c55927d6be4cd1e2a3cb5dae96f4b7ca3690008d4cd4f7f9cb8907b2d","observation_id":"118895c3-fe4d-4939-a665-eb562c218552","resolution":{"observed_at":"2026-08-08T10:16:59.457475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06790","last_updated":"2023-04-13T19:23:52Z","snapshot_observed_at":"2026-08-05T23:54:40.289344Z","submitted_at":"2023-04-13T19:23:52Z","title":"Inpaint Anything: Segment Anything Meets Image Inpainting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06790","snapshot_observed_at":"2026-08-08T10:16:59.208911Z","title":"Inpaint anything: Segment anything meets image inpainting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.208911Z"},"links":{"cited_paper":"/paper/2304.06790","citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:828b8a5257a7f90ffd7a48e33007d919ae41b2128e9312fc8db371c1d86955b1","observation_id":"223e78f5-7d9e-47c8-8291-4086f19121d8","resolution":{"observed_at":"2026-08-08T10:16:59.208911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.436800Z","title":"Segfix: Model-agnostic boundary refinement for segmenta- tion","venue":null,"work_id":"e68ab236-0933-40d0-8653-0ba51606cdf7","year":2020},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.213808Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:e99925069fc2c43c594344f7ae5080dc1f7e7bc1571914553add811a024d90d0","observation_id":"5411252a-2879-49c9-b573-a0f462db2a1a","resolution":{"observed_at":"2026-08-08T10:16:59.441804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.418254Z","title":"Towards high-resolution salient object detec- tion","venue":null,"work_id":"66bbf495-e11f-4c7a-a66e-e3d6a6829ecb","year":2019},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.218287Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:da088676abe0da65c60b31ad36fd1a9cd86cb71ed89fc9e9c3146392b030dffa","observation_id":"ef5fbb56-639f-4430-9313-b0eecc9fd3df","resolution":{"observed_at":"2026-08-08T10:16:59.425908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:16:59.222616Z","title":"Pyramid scene parsing network","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T10:16:59.222616Z"},"links":{"citing_paper":"/paper/2502.09660"},"observation_digest":"sha256:52807484c6944c64b358eae5fee6c01728c41e66950ab6610e17d7c285bd9199","observation_id":"df961242-06c7-4beb-a5ca-48a9fab72097","resolution":{"observed_at":"2026-08-08T10:16:59.222616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.09660","last_updated":"2025-02-12T06:38:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T10:11:04.928000Z","submitted_at":"2025-02-12T06:38:18Z","title":"Towards Fine-grained Interactive Segmentation in Images and Videos"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2502.09660."}