{"as_of":"2026-08-20T13:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c825885a929e314e3a295b40f4bae0ee6927c460ffc13710c43eb608a6f67bf6","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T03:04:57.109924Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.08688/citation-record","integrity":"/paper/2607.08688/integrity","json":"/paper/2607.08688/citation-record.json","paper":"/paper/2607.08688"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.960959Z","title":"MOSE: A new dataset for video object segmentation in complex scenes","venue":null,"work_id":"7a146bd9-5a30-45d1-ba53-8e98ee77678a","year":2023},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:6a4ce515e7adca0751f69faa54556ea09f734e2cc24615afe6c65f241ab748ab","observation_id":"828e8133-13c3-4c05-9f41-374665f742f2","resolution":{"observed_at":"2026-07-10T03:06:43.962222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.05630","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.588255Z","title":"MOSEv2: A more challenging dataset for video object segmentation in complex scenes","venue":null,"work_id":"5e313244-b6d4-40a5-ba70-6f060ec438db","year":2025},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:c5ce63a4765af41a1cb99f2fec459be71aa8aa20e5fa647465157dba99d776ca","observation_id":"50b89bc8-651a-4e15-9721-e9947a33758d","resolution":{"observed_at":"2026-07-10T03:06:43.590309Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.880647Z","title":"Genie: A generalizable navigation system for in-the-wild environments.IEEE Robotics and Automation Letters, 2025","venue":null,"work_id":"0cbfb28f-cfdf-4b19-b7ee-c0e43ae97b79","year":2025},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:4c29cd6e8baf08f797a41b08e112378e447f321eb1e415162eab5e8ea860a28d","observation_id":"9f1a42d9-39c3-4071-8276-5937315ea7cd","resolution":{"observed_at":"2026-07-10T03:06:43.881974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.863949Z","title":"Video object segmentation-based visual servo control and object depth estimation on a mobile robot","venue":null,"work_id":"97963617-dc99-46d7-a502-ac6a72524715","year":2020},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:bbb118302204ad221511693ddc90bc0179012c201be1edbcf31a13e4e48770ad","observation_id":"53afb98e-4a04-4271-8290-a538370892b3","resolution":{"observed_at":"2026-07-10T03:06:43.865260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.857550Z","title":"Video object segmentation using space-time memory networks","venue":null,"work_id":"2768c4bf-7f1c-424e-b1fc-66fb1ca77598","year":2019},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:256db9b92d12c1eb2f478854dacfc7ea7f8aacc0d8b1c787936d99973ed76114","observation_id":"3f9daccc-03a4-45c7-b1ff-df87d9306c23","resolution":{"observed_at":"2026-07-10T03:06:43.858864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.939997Z","title":"Rethinking space-time networks with improved memory coverage for efficient video object segmentation","venue":null,"work_id":"f9e545aa-2829-4bd5-8f60-96fe8740adbb","year":2021},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:ff5eb2f648d2d1f1e49ac7c97fc209a38c0e2ac3be4441c7b3809b19f321dcdb","observation_id":"c3a1d15b-29ff-4cd1-b967-0031e7aa4989","resolution":{"observed_at":"2026-07-10T03:06:43.941432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.931764Z","title":"Xmem: Long-term video object segmentation with an atkinson-shiffrin memory model","venue":null,"work_id":"e29625de-c913-424f-a076-75cb8622b2e8","year":2022},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:a9c5292c5c6ac1d2b3db34f3b0464c17f8e2667e82900645c477e160dc4207f1","observation_id":"35db4574-bd18-4991-8187-1479b52b351e","resolution":{"observed_at":"2026-07-10T03:06:43.933424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.936275Z","title":"Putting the object back into video object segmentation","venue":null,"work_id":"c0490f16-852a-4a99-a52d-0c9ceeb3a220","year":2024},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:0b5aa995b352e14705514c7872bd6a29957304c1e95aa7415e07add0e04e4a9e","observation_id":"f6689e78-df52-4fa8-9ba6-5a156a931f38","resolution":{"observed_at":"2026-07-10T03:06:43.937573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.871957Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":"d5d12812-5493-4ab5-b33d-75b1c01cc725","year":2025},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:09c0bebeeda71626c8b688d61845e51f04e0fe63c42ad2eb67da2f998d806103","observation_id":"a737784b-b10e-4c63-b788-e7ee57da023c","resolution":{"observed_at":"2026-07-10T03:06:43.873184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.891028Z","title":"Sam2long: Enhancing sam 2 for long video segmentation with a training-free memory tree","venue":null,"work_id":"f003f79f-ddfa-468c-a5f3-96366313184c","year":2025},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:4c35f0f7e299741033cded7698da0a699bdfaa9b5ddacea0de0f1c50f0426b68","observation_id":"7fc1cf10-d5ca-4221-b3b8-44f58f2c6361","resolution":{"observed_at":"2026-07-10T03:06:43.892369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.937460Z","title":"MeViS: A large-scale benchmark for video segmentation with motion expressions","venue":null,"work_id":"94ce611d-2f0c-4fc1-954a-251bdfefb8c0","year":2023},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:0484d6d74b7380cc0085e9febd0467b4a5495eabe8ffb0cd1e7639a4ec184fb0","observation_id":"ab96b837-5e1b-4046-b5a1-46212837888a","resolution":{"observed_at":"2026-07-10T03:06:43.938679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.935382Z","title":"MeViS: A multi-modal dataset for referring motion expression video segmentation.IEEE TPAMI, 47(12):11400–11416, 2025","venue":null,"work_id":"2cd149d6-a1ea-4b56-94e6-bb5cf46de4f4","year":2025},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:4cb955e928e075cea9af0fe6f11415be1e7b4505e1bade66561da18e8b883a0a","observation_id":"a5e4d703-6beb-4763-b65f-13b6920a71cd","resolution":{"observed_at":"2026-07-10T03:06:43.936860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11922","last_updated":"2024-11-30T22:32:34Z","snapshot_observed_at":"2026-08-19T20:51:39.895760Z","submitted_at":"2024-11-18T05:59:03Z","title":"SAMURAI: Adapting Segment Anything Model for Zero-Shot Visual Tracking with Motion-Aware Memory","version":2},"cited_work":{"arxiv_id":"2411.11922","doi":"10.48550/arxiv.2411.11922","metadata_source":"pith","pith_arxiv_id":"2411.11922","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Samu- rai: Adapting segment anything model for zero-shot visual tracking with motion-aware memory","venue":"cs.CV","work_id":"674b0e1d-b2cd-4f05-be76-259084dae1ec","year":2024},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"cited_paper":"/paper/2411.11922","citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:e01f1cec076ff3b0ffe6965c11b21391c3f8aedad96d743209b3cdc4dafa6e17","observation_id":"df158df1-66b3-4c15-8e00-63a9bffddb3a","resolution":{"observed_at":"2026-07-10T03:06:43.593613Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.959009Z","title":"A distractor-aware memory for visual object tracking with sam2","venue":null,"work_id":"bd752c04-8844-4c74-ad7a-538daf8d042e","year":2025},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:246b92e37a057101b35a6dba21e35cc9ab34217af02024a011e36fe9fb2a6b8a","observation_id":"7a7c2a76-4956-44fc-a2a1-3f2a261c5cab","resolution":{"observed_at":"2026-07-10T03:06:43.960246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.922750Z","title":"Modular interactive video object segmentation: Interaction- to-mask, propagation and difference-aware fusion","venue":null,"work_id":"d1421cc8-7906-4c12-bd30-7e159f8dcb25","year":2021},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:da37b7210e4868ed2d1eed205c1ae1c3ffed39935f3bdb727baef13e39b4cf97","observation_id":"c46bdff7-3ec0-4f3c-83af-982324227488","resolution":{"observed_at":"2026-07-10T03:06:43.924366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.938173Z","title":"Learning position and target consistency for memory-based video object segmentation","venue":null,"work_id":"f56f3e3c-2ce7-4f76-967c-db870a437160","year":2021},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:47422bb2c00999aafa4ac362b81b85cd031578d98d25e8341bbb57a3713de078","observation_id":"358eb817-b68c-4835-83f2-ef9a107719ef","resolution":{"observed_at":"2026-07-10T03:06:43.939435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.953061Z","title":"Efficient regional memory network for video object segmentation","venue":null,"work_id":"2c8c3653-ed50-43f3-ae47-f3c052b6c556","year":2021},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:23ad14680b4f286dd211722095c99e224b2834c118e251717a3f545d69fd92bf","observation_id":"888d7a63-9384-4efe-aa14-e7e8079386e1","resolution":{"observed_at":"2026-07-10T03:06:43.954348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.931321Z","title":"Swiftnet: Real-timevideoobjectsegmentation","venue":null,"work_id":"9db8b76b-8600-460b-86c7-67b2a4bca29b","year":2021},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:15421a7ccb298df1203a26c03b1c4c82fedd507b3b54b04227e9810d799c533e","observation_id":"161a26fc-b068-4cea-86b0-3bcea8907cc3","resolution":{"observed_at":"2026-07-10T03:06:43.932494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.929185Z","title":"Xmem++: Production-level video segmentation from few annotated frames","venue":null,"work_id":"17d787b5-b319-4136-97b6-2a72b3799328","year":2023},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:d7a8f4d31a9499ca35bbdb6b892952dc4d912685541733f6623f00e41d274f12","observation_id":"0a58ad69-d8b4-421f-b708-fefc99e3e5e4","resolution":{"observed_at":"2026-07-10T03:06:43.930626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.912465Z","title":"Tracking anything with decoupled video segmentation","venue":null,"work_id":"023b673f-4056-4cf9-83e6-9c293cafa48e","year":2023},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:91f5509d7efa378450e20d7f74239af3ce884afe19bcff354ab2411cf7222239","observation_id":"298dfe0f-b1aa-4bcf-9521-54b7e69cdce6","resolution":{"observed_at":"2026-07-10T03:06:43.913875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.918019Z","title":"Lvos: A benchmark for large-scale long-term video object segmentation.IEEE TPAMI, 2025","venue":null,"work_id":"a5e10894-b464-42c3-bfb3-bde90e3fd644","year":2025},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:00a5d1c4eafeef033bdec92e868e01732b3ae5d62841104f969c0b0a2966049f","observation_id":"4eaf65a2-4ca2-4791-b4ac-8231477cf861","resolution":{"observed_at":"2026-07-10T03:06:43.919650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.912282Z","title":"Hierarchical memory matching network for video object segmentation","venue":null,"work_id":"b47280a7-faf0-49ab-92b7-90ecd43eeed2","year":2021},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:97e6c59cce673e8d38cc6f59a209e293788b3324d97c4fe8f5ca7bc4bf50ddc2","observation_id":"3407bac9-c7c8-4b40-8a9e-f29a430064ce","resolution":{"observed_at":"2026-07-10T03:06:43.913547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.924977Z","title":"Per-clip video object segmentation","venue":null,"work_id":"b2ed9cfe-d088-44fc-afb2-d3bc3bd06aa8","year":2022},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:c503860419d488049c65b7fbc534260499c8634cf5a328daae7e2554e207980d","observation_id":"d5eac60c-6812-4860-928c-c81c9979056c","resolution":{"observed_at":"2026-07-10T03:06:43.926261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.927099Z","title":"Transformer-based visual segmentation: A survey.IEEE TPAMI, 2024","venue":null,"work_id":"66cf1ee2-8d68-46ec-b55a-dad863d29ec0","year":2024},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:280ed085465ba17717709966b675318c074d16535d8c572083083630aefabfbb","observation_id":"199e1015-8f1c-4b6b-adb9-90bae8869fba","resolution":{"observed_at":"2026-07-10T03:06:43.928397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.904196Z","title":"Towards open vocabulary learning: A survey.IEEE TPAMI, 2024","venue":null,"work_id":"eb95c43f-b1c7-48df-98d0-1728f2cb7b0d","year":2024},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:3b65c889df69a1b260cd313a10d3ef55ca56d48224dd79cbe71a892fffff712e","observation_id":"e5b54164-1eb4-49dd-9545-d3effec09adf","resolution":{"observed_at":"2026-07-10T03:06:43.905492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.933301Z","title":"VLT: Vision-language transformer and query generation for referring segmentation.IEEE TPAMI, 45(6):7900–7916, 2023","venue":null,"work_id":"27aeb945-2c18-49e6-94b5-657113251a3a","year":2023},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:f84e4f890a41be24f59dc118722b47807fabaf1e3194a9ada6e9621983b111e5","observation_id":"c3bb0124-60d0-4d1d-99e3-60b2b6e7d6cb","resolution":{"observed_at":"2026-07-10T03:06:43.934741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.902024Z","title":"Multimodal referring segmentation: A survey.IJCV, 2026","venue":null,"work_id":"3fea426b-07d6-46d0-a3ff-ee8ffffb73c9","year":2026},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:d8a229e2c2853de50c2af62f8122bcbcc16911cf93e6af627f887fb05c8e0eb1","observation_id":"0eadb7b5-b2fe-4b00-9347-8776de0fbdb3","resolution":{"observed_at":"2026-07-10T03:06:43.903960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.884741Z","title":"Per-pixel classification is not all you need for semantic segmentation.NeurIPS, 34:17864–17875, 2021","venue":null,"work_id":"07d123b0-12e4-4f93-9b30-34e33e7edf9d","year":2021},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:4bd72f5420a165486cdd690379258104267df8a7490211dc0a1d2608f357c27c","observation_id":"b6a719ee-99cb-4528-88fe-cb3b270ccb94","resolution":{"observed_at":"2026-07-10T03:06:43.886050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.916272Z","title":"Scaling open-vocabulary image segmentation with image-level labels","venue":null,"work_id":"51e12809-ad7f-4695-8c95-bee8d1bfbd48","year":2022},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:5bc62a30ce084fae9917c508e0a85a98b9e859118ebde39ec7b65d99fd857072","observation_id":"fc179b54-0c28-428f-b06d-7b46a2b8a0a2","resolution":{"observed_at":"2026-07-10T03:06:43.917518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.920377Z","title":"Masked-attention mask transformer for universal image segmentation","venue":null,"work_id":"bf98b5b2-dbd2-4dd6-b33f-e08cabbb5ad9","year":2022},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:22b8630d1033c78ef15bda287ad386c76dcb4ff5addc18b407946a534df624d6","observation_id":"725c7da1-da0b-4bc2-a376-bc8604f24d88","resolution":{"observed_at":"2026-07-10T03:06:43.921831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.962885Z","title":"Fastinst: A simple query-based model for real-time instance segmentation","venue":null,"work_id":"8ef46d01-65d4-4a68-84fb-6aee05c5025e","year":2023},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:d69d0c66a95ff19f934a2fc3497c729bbf1b210801cef5763f5f07d1bf056e7c","observation_id":"58714759-d678-417e-8d25-9ab3673e352e","resolution":{"observed_at":"2026-07-10T03:06:43.964130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.906123Z","title":"A survey on 3d gaussian splatting in segmentation, editing and generation.IEEE TPAMI, 2026","venue":null,"work_id":"2ab4c939-c60d-4784-aaa6-4588623e804a","year":2026},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:990560f40178dfba69a53b83e761d135b2bb0c498327d7b1199f1d4fde7a71dc","observation_id":"4b04e013-8eb5-47c6-bbe4-d99598a44ca1","resolution":{"observed_at":"2026-07-10T03:06:43.907542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.918413Z","title":"Mask dino: Towards a unified transformer-based framework for object detection and segmentation","venue":null,"work_id":"6cd53fac-942f-4c2a-8be2-be159bd2e970","year":2023},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:a3ab0e55d4ab63a05fe07b20231fea72ece3382e00d54e5dc8bc7b2201bc8e4a","observation_id":"e2844507-dded-4b42-bda8-e9846dacb814","resolution":{"observed_at":"2026-07-10T03:06:43.919825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.904462Z","title":"Oneformer: One transformer to rule universal image segmentation","venue":null,"work_id":"33a3f729-9e29-446a-9bc3-a10f800c1e8c","year":2023},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:3c21c8221a436eae85d982ae3e125a5e4dc28d38db20facd2093057ac249fd4a","observation_id":"c81c906c-a51b-426b-ac39-48c4852c9b50","resolution":{"observed_at":"2026-07-10T03:06:43.905656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.908517Z","title":"Segment anything","venue":null,"work_id":"ffd866b4-b8b4-4924-887d-af662dde5bdc","year":2023},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:27d88fd51ac272c5fa9d58a63b20f77878c9f36fff1beac27fe5a5e63fc91082","observation_id":"5a9ff550-7f68-42c7-a856-1a2a6a16ee27","resolution":{"observed_at":"2026-07-10T03:06:43.909684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.898322Z","title":"Segment anything in high quality.NeurIPS, 36:29914–29934, 2023","venue":null,"work_id":"01c3450f-ee64-4eb0-a6a9-ec444fbb4cdc","year":2023},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:e03eea7aa33e35af6e0da2036a887eb8cf7ac771e31b73f2266bd09675e0c508","observation_id":"d9eb9627-9c59-4736-9ee1-bb79eb3c7b9a","resolution":{"observed_at":"2026-07-10T03:06:43.899560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.914556Z","title":"Entitysam: Segment everything in video","venue":null,"work_id":"787bc25e-b387-453e-99a7-82e8d59497d4","year":2025},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:bcc0979adb06e0510d4df3c35257ed3c612b5758a3031b920c27601c0f74531e","observation_id":"a2c2218b-556c-4bdd-91d4-c672bdeb00e0","resolution":{"observed_at":"2026-07-10T03:06:43.915786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.924688Z","title":"GRES: Generalized referring expression segmentation","venue":null,"work_id":"32f60981-048e-49b8-9daa-a4f9a34a3125","year":2023},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:262f52713d89107f54548c99bd8f5a94735af5c1b7f2f72f8de49ad437da1e0a","observation_id":"9184c21b-0b06-4727-ade7-d8a3d7260127","resolution":{"observed_at":"2026-07-10T03:06:43.926061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.876293Z","title":"Vision-language transformer and query generation for referring segmentation","venue":null,"work_id":"02b25a1a-2044-4956-896b-26a0f30d66e1","year":2021},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:9273efe54b99c435d78d24abd2479e044427718d82c78b487918fc1fb4736b43","observation_id":"528dbb0a-9b39-4475-aa3d-9547e8dcf970","resolution":{"observed_at":"2026-07-10T03:06:43.877720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.867858Z","title":"Continual learning for image segmentation with dynamic query.IEEE Transactions on Circuits and Systems for Video Technology, 34 (6):4874–4886, 2023","venue":null,"work_id":"02df1aa3-1094-4f16-b10a-0ebf30b13f88","year":2023},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:8d04e01a076b29a6cea9261645df35251f8837f7150e295a8a05de37c6e9d4b5","observation_id":"f39d8cb2-5a0c-4ccc-a3f7-7c6a1181246e","resolution":{"observed_at":"2026-07-10T03:06:43.869386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.869994Z","title":"Rethinking query-based transformer for continual image segmentation","venue":null,"work_id":"979d2603-811d-4f12-8092-36350cccdebe","year":2025},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:117352885da7b72d4ecf83127150b29d13667b2380bbb44fa8b6295eebdc1607","observation_id":"2d56c772-f1b1-4dc9-a720-126e5fb52226","resolution":{"observed_at":"2026-07-10T03:06:43.871299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.892604Z","title":"Primitivenet: decomposing the global constraints for referring segmentation.Visual Intelligence, 2(1):16, 2024","venue":null,"work_id":"f3c1c141-2dd0-484a-9ccc-e86775403991","year":2024},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:36a48c9b98331fb489ff59bdfa037b90b6db8d67d09b683466e57e99e01d26ce","observation_id":"40c27ab0-2a6e-47a7-a907-2191408491a9","resolution":{"observed_at":"2026-07-10T03:06:43.893859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.939271Z","title":"GREx: Generalized referring expression segmentation, comprehension, and generation.IJCV, 2026","venue":null,"work_id":"6b4eceb9-6098-492b-b024-54e5703ee664","year":2026},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:711de5eac05cf94276a778c02fe853e25cddf5367f8f63c3f4d4732d6047cf01","observation_id":"c23fbff6-1f85-46ab-97e7-6a407f459a16","resolution":{"observed_at":"2026-07-10T03:06:43.940636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.896366Z","title":"Fully convolutional networks for semantic segmentation","venue":null,"work_id":"5b0e7266-da68-4fb2-85e9-be8a15f73f4f","year":2015},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:0c72667f884ebc97957075ce9f0e350402bf30cc86efc9dd98dbebf326c20d7c","observation_id":"6d9ccf74-0757-4304-b706-49656dde6509","resolution":{"observed_at":"2026-07-10T03:06:43.897559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.920598Z","title":"Deeplab: Semantic image segmentation with deep convolutional nets, atrous convolution, and fully connected crfs.IEEE TPAMI, 40 (4):834–848, 2017","venue":null,"work_id":"41d72a6c-1129-4d08-84be-4ea2ff80c1e8","year":2017},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:25c7b6196fb90d87e834b1202296bea1787a4c43e26d481c866f74b1fbb6db12","observation_id":"f3acd39c-a09a-4082-8c6d-d3fa14e6d4db","resolution":{"observed_at":"2026-07-10T03:06:43.921990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.964739Z","title":"Mask r-cnn","venue":null,"work_id":"8f61442e-c0e5-41a1-8dcf-4dfe4d32b1ee","year":2017},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:8ce68df88fc850b0ba40636074920aa5e015fb0f5e55a1e871fa781dbc5a118a","observation_id":"2768820e-3894-4f02-847c-a553ae81758f","resolution":{"observed_at":"2026-07-10T03:06:43.965959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.947092Z","title":"Boundary-preserving mask r-cnn","venue":null,"work_id":"978c475a-1978-430b-bf07-18befe58df3b","year":2020},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:1bcf49ff284ef17a5b95ef3a0ae525399da91868fde6f182b54dbd090c85e7a2","observation_id":"f380a21f-ad29-45a0-8f66-da1da372ddda","resolution":{"observed_at":"2026-07-10T03:06:43.948469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.949279Z","title":"Attention is all you need","venue":null,"work_id":"ce4dc515-0a2c-4276-a794-9273d2ee1c04","year":2017},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:a22f41f3253e0ab16cc77ae17713913e125fbb706c93707905c99f621bd02097","observation_id":"1a457714-7e6c-4925-996d-6a14c7b32e49","resolution":{"observed_at":"2026-07-10T03:06:43.950617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-18T18:30:41.010430Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":"2112.10764","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-07-10T03:06:43.601051Z","title":"Mask2former for video instance segmentation","venue":"cs.CV","work_id":"b1131c21-30c6-499a-a423-eef12442cb11","year":2021},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:d06f1ee5d063ff6f81db7b7d3ebe58ae0ea1c779c9a4b65f8a13ed5fbd44bd71","observation_id":"aacbb5a3-64a2-4e90-bd87-ffdedc95b691","resolution":{"observed_at":"2026-07-10T03:06:43.602664Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.943353Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"8f1690df-f624-4ad6-b0d2-ec88c2e0316e","year":2016},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:073647a8ddb341500bcc7ef958fbec107a3ec0f2465850dc9e7110773129a0c9","observation_id":"431a1c91-eb72-410d-929f-93f2236e182f","resolution":{"observed_at":"2026-07-10T03:06:43.944572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.941303Z","title":"Lvos: A benchmark for long-term video object segmentation","venue":null,"work_id":"57972a42-611d-44aa-8be7-6065822ef031","year":2023},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:bbe70e134246659fe19fca489632be73e16a8d4eb4ef5dda971f922d7a0e5618","observation_id":"6c91dd84-4627-4991-9a2c-2245878ef10e","resolution":{"observed_at":"2026-07-10T03:06:43.942564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.951233Z","title":"Associating objects with transformers for video object segmentation","venue":null,"work_id":"8552f602-83fe-46fb-8667-74b39d59d638","year":2021},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:12bd6ddbb9ecb13436ecce49566168f5166176df6eb8ace9ba7005bb1323b4fc","observation_id":"269cdef4-8cf0-46aa-ae11-58c1b05fd85a","resolution":{"observed_at":"2026-07-10T03:06:43.952449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.955268Z","title":"Decoupling features in hierarchical propagation for video object segmentation","venue":null,"work_id":"bd60ad21-5e28-4d52-ab64-38f7d3d9a456","year":2022},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:5676f3f9bf8889a1dbcd9f67909e1763350f18be0ffbe92c75f3f0fa04596169","observation_id":"60e55d6b-71be-4a68-8055-c51090c1c37d","resolution":{"observed_at":"2026-07-10T03:06:43.956487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.957183Z","title":"Recurrent dynamic embedding for video object segmentation","venue":null,"work_id":"eaeb27ca-b1f1-4afe-a196-2df6626dc15e","year":2022},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:6d1c177531333be2054a11a749e9213eb8c0eb39114cd1116bf040e3dd98885f","observation_id":"58aa81f1-2b53-49f7-99b7-a5a1df4f439f","resolution":{"observed_at":"2026-07-10T03:06:43.958457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.966629Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":"65ea6a8f-17d6-47e9-b126-0d1ea82dd36d","year":2024},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:5554bd307af36fd60c85d6315d9aa72e251792029a828cb6efad259d92a6ca90","observation_id":"323c6fae-5e33-47f6-9d5c-cb8cadaa007a","resolution":{"observed_at":"2026-07-10T03:06:43.967847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.894842Z","title":"Adamcot: Rethinking cross-lingual factual reasoning through adaptive multilingual chain-of-thought","venue":null,"work_id":"eb5a96e2-2c95-45b1-9b8b-a19f179f6177","year":2026},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:15f5d9c000d79bad62c086d942bb8ac3e67780a18c55ca83cc7ab3ba1554d047","observation_id":"18829729-5dd8-44c4-9eab-9bddecfc242f","resolution":{"observed_at":"2026-07-10T03:06:43.896537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.893000Z","title":"Ccl-xcot: An efficient cross-lingual knowledge transfer method for mitigating hallucination generation","venue":null,"work_id":"65810bee-cbc7-41e5-a4b0-b675d44bb39f","year":2025},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:00ae538ac4f1f7b0f585856360e3cf7ff1e7ac1c2e44438419d9f6b0e437bfe4","observation_id":"1791961e-de55-4ebb-8c53-3ee26c2ee274","resolution":{"observed_at":"2026-07-10T03:06:43.894233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.945291Z","title":"One token to seg them all: Language instructed reasoning segmentation in videos","venue":null,"work_id":"870c9f55-528b-400c-938e-0640a430b0ef","year":2024},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:7da023caf2d06e4328d37d115c2eb1a7258aafd1551de9854cf25ea6fa71c8e8","observation_id":"416097cd-bf9d-4a1a-944f-ca0b51896f57","resolution":{"observed_at":"2026-07-10T03:06:43.946521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-08-16T10:23:40.545862Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"cited_work":{"arxiv_id":"2501.04001","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.04001","snapshot_observed_at":"2026-07-10T03:06:43.598138Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","venue":"cs.CV","work_id":"fbffda10-106c-432c-b84e-5d0908666921","year":2025},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"cited_paper":"/paper/2501.04001","citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:8997f77d4915256ad3e297a19f1f8bb20964e8c9397f13c143387bb15478bc7b","observation_id":"ecbc4ea4-6c23-49b2-8f71-8b41ecf7c2cb","resolution":{"observed_at":"2026-07-10T03:06:43.599834Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.08608","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.595053Z","title":"InACM MM, pages 2880–2889","venue":null,"work_id":"cad000f4-e628-4b2c-95ec-7be4f2dea5d5","year":2025},"citing_paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-10T03:04:57.109924Z"},"links":{"citing_paper":"/paper/2607.08688"},"observation_digest":"sha256:6597669cafb3c15ddd4d8661f5d5401fe95df6a9ded32419d7194ab677b80ce8","observation_id":"0177f891-ccea-405f-ad11-45cb2e1a67e0","resolution":{"observed_at":"2026-07-10T03:06:43.596828Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.08688","last_updated":"2026-07-09T16:49:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T11:04:47.760690Z","submitted_at":"2026-07-09T16:49:57Z","title":"SAM-MT: Real-Time Interactive Multi-Target Video Segmentation"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":4,"verified_fuzzy":55},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2607.08688."}