{"as_of":"2026-08-17T00:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f2700b1020fe6bc6b3f68b1b314a2e2124b4cc4790f6e0ef0a2beef03c24bc52","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T05:23:32.202297Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:26:29.380459Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T00:19:13.707397Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"cited_work":{"arxiv_id":"2605.20110","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.20110","snapshot_observed_at":"2026-07-04T00:19:13.707397Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","venue":"cs.CV","work_id":"0bb18c53-aedf-4bf5-81bf-fcfeb94061d2","year":2026},"citing_paper":{"arxiv_id":"2606.19338","last_updated":"2026-06-17T17:59:34Z","snapshot_observed_at":"2026-07-06T23:54:37.596257Z","submitted_at":"2026-06-17T17:59:34Z","title":"Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-06-26T21:17:02.332687Z"},"links":{"cited_paper":"/paper/2605.20110","citing_paper":"/paper/2606.19338"},"observation_digest":"sha256:ee4cbc814fac404b01e2e382146df8ac3330fd493518f779cc9e0ca6519711b9","observation_id":"0db5790d-6502-408a-aaf6-ed4cafb42c71","resolution":{"observed_at":"2026-07-04T00:19:13.708634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.20110","snapshot_observed_at":"2026-08-05T04:26:29.380459Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02636","last_updated":"2026-07-31T04:02:51Z","snapshot_observed_at":"2026-08-16T15:56:59.390576Z","submitted_at":"2026-07-31T04:02:51Z","title":"Rethinking Self-Evolving Agent Skills: Feedback Dynamics over Multiple Rounds","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T04:26:29.380459Z"},"links":{"cited_paper":"/paper/2605.20110","citing_paper":"/paper/2608.02636"},"observation_digest":"sha256:a8e7420ceaa13da78db7c33eeff84e65ed4b1576cfff1180deb1157bca7a7059","observation_id":"0d7abf58-df95-434f-8ac0-5523cb524756","resolution":{"observed_at":"2026-08-05T04:26:29.380459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.20110/citation-record","integrity":"/paper/2605.20110/integrity","json":"/paper/2605.20110/citation-record.json","paper":"/paper/2605.20110"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:423bd8663f438c5fdbba06e1ed9ba00fe161fd525c984f78e15fff860c037a0d","observation_id":"3eb87b22-ca74-4fd6-a80d-0625405867dc","resolution":{"observed_at":"2026-05-20T05:28:05.178224Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"One token to seg them all: Language instructed reasoning segmentation in videos.Advances in Neural Information Processing Systems, pages 6833–6859","venue":null,"work_id":"8adea8f8-b46e-47a1-849e-12410d63e46d","year":2024},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:e87de416acfcd44885defc14bd91690f7fee74444351f092d2e5d72225aaed07","observation_id":"76a43aa4-fa76-4894-a94b-cc6ef11e4f70","resolution":{"observed_at":"2026-05-20T05:48:05.343595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sam 3: Segment anything with concepts","venue":null,"work_id":"0d25f2f9-4b82-4fc2-9a46-f326ac62af40","year":2026},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:e7a7b2d2879a6bd596ded8df7998885d06129128edb926fde2db619367daa368","observation_id":"537249cd-a9b6-4950-bb87-f14a52f8a6b8","resolution":{"observed_at":"2026-05-20T05:43:25.485453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end object detection with transformers","venue":null,"work_id":"5e09cd44-4cc1-43fc-9e4b-cd8937617f64","year":2020},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:44b15205e985481693e1c2eee22dd179870a6dce83218ac98b7e6acd1d1d0857","observation_id":"b84410cd-2886-4581-b02f-e5dd1de15705","resolution":{"observed_at":"2026-05-20T05:43:25.420852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sam4mllm: Enhance multi-modal large language model for referring expression segmentation","venue":null,"work_id":"03394d90-e10f-498e-9e02-cea821c11bd5","year":2024},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:fd821550fb038c76bd589a0a63b636a51507e85cd0d24b9de3ea4bf2a9a0f5df","observation_id":"b79a0389-ccdb-473c-8194-0d3e54b72a31","resolution":{"observed_at":"2026-05-20T05:43:25.505752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Samwise: Infusing wisdom in sam2 for text-driven video segmentation","venue":null,"work_id":"716a6e07-39f9-4d16-929b-40aa8c2a7013","year":2025},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:941a43508db097ccfc5318160bf52c3ded75553c7c1ab09ae1a42d6f2e5452a1","observation_id":"adb172a5-1d0f-476b-bde4-aa1fc1c2ed7e","resolution":{"observed_at":"2026-05-20T05:43:25.584627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:24:27.668286Z","title":"Mevis: A large-scale benchmark for video segmentation with motion expressions","venue":null,"work_id":"612a06b8-46af-43a6-8ca7-b418bdd7a1f8","year":2023},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:f5db5482509890888892de3169da19fc664e2b007e0d4c963e0da9d1d6d63a68","observation_id":"4dd02138-6991-4721-a4f2-7517e19b8fc8","resolution":{"observed_at":"2026-05-20T05:43:25.547045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mevis: A multi-modal dataset for referring motion expression video segmentation.IEEE Transactions on Pattern Analysis and Machine Intelligence","venue":null,"work_id":"b9160797-a94c-4f9b-9d3f-da8a1e4f5114","year":2025},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:ce3a3ebb1a4f74dc30c9100624cbb48b069239172969efe86e00697e34293f7e","observation_id":"f0f2a0f5-8269-4eda-a32c-4a73f2323b20","resolution":{"observed_at":"2026-05-20T05:43:25.345611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vlt: Vision-language transformer and query generation for referring segmentation.IEEE Transactions on Pattern Analysis and Machine Intelligence, pages 7900–7916","venue":null,"work_id":"fe3e7baf-d8e1-4c94-a6a2-a7389b4edbcd","year":2022},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:af7d7f5bd48803cff49effef5e59b78fd7231c5bb31ea41d898d05329dcc33c2","observation_id":"738c484c-458b-4d6f-8100-226a69cd7b6e","resolution":{"observed_at":"2026-05-20T05:43:25.445528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sam2long: Enhancing sam 2 for long video segmentation with a training-free memory tree","venue":null,"work_id":"e158fb39-d4e6-40a9-94b7-5b2d7e6b858a","year":2025},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:31b2e8cbd69ed286b7cebff523565e550b9d70a8334778bd364b49eff2dd4425","observation_id":"eba51d53-d74b-4f53-876f-594b053c060d","resolution":{"observed_at":"2026-05-20T05:43:25.448119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language-bridged spatial-temporal interaction for referring video object segmentation","venue":null,"work_id":"42e4a460-6f41-489d-8cff-cd2b7097dd0e","year":2022},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:441e71d49bbfc55e5baa5b81080f88b9030129e718dfc8933149bb45b972b433","observation_id":"f8c2b1c0-d4c3-4e68-b209-7911ffe5e812","resolution":{"observed_at":"2026-05-20T05:43:25.350038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Palm-e: an embodied multimodal language model","venue":null,"work_id":"0f25039b-86b0-4c2f-a1ac-65c4f87043a6","year":2023},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:fdd172984b2dba52fe07fae8efce16996bd266a506316b2441138c259e5a2df3","observation_id":"0030514d-a3ea-4d51-a3e7-bdf183d20c61","resolution":{"observed_at":"2026-05-20T05:48:05.346036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The devil is in temporal token: High quality video reasoning segmentation","venue":null,"work_id":"a24b030c-6e0b-4e09-949b-b8cf365812e9","year":2025},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:14b3cb74214edc29693bfba35c4b1a61f2489e8728d8f9c67cd390982a26a973","observation_id":"65221503-1609-4bc9-af69-db1be65ff5b8","resolution":{"observed_at":"2026-05-20T05:48:05.338496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Anomalygpt: Detecting industrial anomalies using large vision-language models","venue":null,"work_id":"462d1421-d8d9-48d8-ba54-307860922982","year":1932},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:253069b5a1393985a4b1a5e75f303deb34d247dbe9d9447fc306986560936e12","observation_id":"d5632eb5-18fe-4e92-b789-a9b13b3c8bfd","resolution":{"observed_at":"2026-05-20T05:43:25.580828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Html: Hybrid temporal-scale multimodal learning framework for referring video object segmentation","venue":null,"work_id":"98322494-e7d4-4904-b020-6ffe75541fa8","year":2023},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:b7f40ffea398d347167121c2ea2a46843f551faec8dc78af8897ee3a81a4cd4d","observation_id":"b932d839-ba8d-44d2-99dc-3c6007306863","resolution":{"observed_at":"2026-05-20T05:43:25.471242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoupling static and hierarchical motion perception for referring video segmentation","venue":null,"work_id":"2d51dc56-0bfd-4774-9449-8ac73ed55750","year":2024},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:e462381dc795d1bfecefe19229b486224597244a89c1cae6b3854b3ebf69819f","observation_id":"70349b3b-6e2d-485f-9644-c7d2ba1eebfc","resolution":{"observed_at":"2026-05-20T05:43:25.332193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segmentation from natural language expressions","venue":null,"work_id":"06ad5d0a-656b-4d7f-a7d5-7c1fe5b13824","year":2016},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:4eab66388870d8d470f2d7932eb0b5c2530fe03de1c86d75624a5e5a7ceabf96","observation_id":"8b2e50b9-1027-4c6c-a371-caf6020b12df","resolution":{"observed_at":"2026-05-20T05:43:25.483796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond one-to-one: Rethinking the referring image segmentation","venue":null,"work_id":"b12ef305-6dea-4521-b0d1-5ef66c5b4269","year":2023},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:682b1f04c69f36a6c9cd2eb4b5a3689f30054ec7735b19e713d31cfaae63bbf9","observation_id":"c817f34c-adf7-4e4d-9535-e79b01cffcd4","resolution":{"observed_at":"2026-05-20T05:48:05.311963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Densely connected parameter-efficient tuning for referring image segmentation","venue":null,"work_id":"2b57b4a1-14ed-47af-bb4b-e0f57d212e3b","year":2025},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:ee45c4c5e712a121776bf8a102a22b757b6db1b5ced4606627b7bb90ca821209","observation_id":"4f5d4a88-bb00-459d-90bc-c0eaaac131f5","resolution":{"observed_at":"2026-05-20T05:43:25.500977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmr: A large-scale benchmark dataset for multi-target and multi-granularity reasoning segmentation","venue":null,"work_id":"67d5ea07-fd9a-44b1-8274-94dccffbbbb8","year":2025},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:d8f8b0b724bb37c3b854374c96c5a5e8dd8273f6b282ca67c9f94baa81489a92","observation_id":"f5788793-933b-49b6-ba1f-163b149463a7","resolution":{"observed_at":"2026-05-20T05:43:25.490898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mdetr-modulated detection for end-to-end multi-modal understanding","venue":null,"work_id":"70dbbef0-408e-4c3d-8e7a-1041138a9430","year":2021},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:eaf9fa4c236ba79798e867e84fbe491d11655278f0142c5ed16dc0fffc1a7e24","observation_id":"f3999a03-7346-464d-966d-97fe73e50016","resolution":{"observed_at":"2026-05-20T05:43:25.429307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Referitgame: Referring to objects in photographs of natural scenes","venue":null,"work_id":"734240c0-556e-490c-9cb2-4c865fc1e084","year":2014},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:a8cdb502d9562999c9fe986e3e6ab8bd5a97b3de3bd2bcb4e84a0d03d5cd447d","observation_id":"9efdeed2-871b-44f1-845b-42d3e1208133","resolution":{"observed_at":"2026-05-20T05:43:25.542934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video object segmentation with referring expressions","venue":null,"work_id":"2723acce-b2be-4013-b1b6-be0aa5ffa2ec","year":2018},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:45d64772aa89b9ee67dc8acfdecc575078861aa1bc19c8500dcbf1e096d5736e","observation_id":"19624c22-4726-42c1-830d-1c948fc3fbb2","resolution":{"observed_at":"2026-05-20T05:43:25.487777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T17:52:45.338243Z","title":"Segment anything","venue":null,"work_id":"a94cd19f-c16e-4968-8847-f62cec39b43f","year":2023},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:29a2bb785b10d8fc62fd06b8ea7453c75f120255caea3991115b22d8fb8ea5a3","observation_id":"3936b7c1-8714-46ea-b373-06499cc60387","resolution":{"observed_at":"2026-05-20T05:43:25.476625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:55:03.455010Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":"6d37dc41-dc35-4c62-8a98-e009e31a730a","year":2024},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:7ac377a295b48fe77a14da2b2243044b95aa6d833de5b6420327fc54b35057b6","observation_id":"b9ad5cbe-4a8d-470e-8645-70df876210ea","resolution":{"observed_at":"2026-05-20T05:43:25.467243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Text4seg: Reimagining image segmentation as text generation","venue":null,"work_id":"cc98c4ad-046e-4b3c-9974-2d484e7f6c6e","year":2025},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:358af469a7a59eb01d501f78181ba2af543a91bb3b57dca7c80b728d7e6f63e0","observation_id":"fdc7504d-0d66-48c7-b07f-19182bec6635","resolution":{"observed_at":"2026-05-20T05:43:25.475718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounded language-image pre-training","venue":null,"work_id":"9cec7e2f-e72d-4944-9051-6e73f1a1c99c","year":2022},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:000270a841547c2ba7aab08c17a0cea77f3af6f2c72d1a656641120239d2a954","observation_id":"19bc26ee-9c9f-4c10-b491-539122e0fced","resolution":{"observed_at":"2026-05-20T05:43:25.527409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:13:49.475084Z","title":"Gligen: Open-set grounded text-to-image generation","venue":null,"work_id":"dc5f6c4e-4236-4a3e-b27f-64440872e033","year":2023},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:f80f8ced388ccd52d8c2ed4a075a609ca41fad9db7d60d8c4eb9fc9f01c80ff4","observation_id":"81cef537-b0dd-4be5-840e-8d5eda63d0b2","resolution":{"observed_at":"2026-05-20T05:43:25.523279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open-vocabulary semantic segmentation with mask-adapted clip","venue":null,"work_id":"02d05e13-4f42-4336-b8a1-deabbcee7cd0","year":2023},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:cec39811ad189b711fb116f2fa2d05a272ad9ffc17ce85d8002686f1b13694c4","observation_id":"60a05966-5391-4ded-bcda-7b5eb35ac078","resolution":{"observed_at":"2026-05-20T05:43:25.576332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Glus: Global-local reasoning unified into a single large language model for video segmentation","venue":null,"work_id":"28b3a147-b088-4b56-99c4-40f9acb050aa","year":2025},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:a56a03c95ac665540cb72f40f9e770e2a3d6526760a6fcc2e841b4eedb0ea6f2","observation_id":"c6d23df5-ee9e-4003-b5e3-cc0a71c9982e","resolution":{"observed_at":"2026-05-20T05:43:25.538266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gres: Generalized referring expression segmentation","venue":null,"work_id":"db1e5de5-95cd-47f0-81e8-fff3b569ee9c","year":2023},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:c963adc05aa1ae00cb72fcbc811cc929789aef39c8d225694a8bcbf4b69a5ddd","observation_id":"b6194e08-f90d-4b0a-abb2-a6ffd5d65145","resolution":{"observed_at":"2026-05-20T05:43:25.327410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T08:06:57.992758Z","title":"Recurrent multimodal interaction for referring image segmentation","venue":null,"work_id":"1864af1d-930a-4a20-bac4-859192acd344","year":2017},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:549073fb3995fa30922fb73acb99a4b45610b6c5f8c421c0db6f7cfcce4c2285","observation_id":"c83c8857-48a1-4776-8a01-57631030330c","resolution":{"observed_at":"2026-05-20T05:43:25.466234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"7eb29bab-dbb5-4b7f-9477-2a154ea99e57","year":2024},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:f2eefe851423a166e853bb6d3d4b1c36c746e5cd99ee1b2bf66b9c278d5dadd0","observation_id":"dbca0f50-7a81-4537-b173-a6b8d49d175a","resolution":{"observed_at":"2026-05-20T05:48:05.331518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Universal segmen- tation at arbitrary granularity with language instruction","venue":null,"work_id":"a6c700e8-45b2-4ba1-8ee9-3a7cd91b67b6","year":2024},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:9e93750dafde7efd6a215f2dad1ef589629a7f6a6965551bf635a31c274d6fdb","observation_id":"fe49c8e2-58e5-42b8-872d-80c810ca4bcc","resolution":{"observed_at":"2026-05-20T05:43:25.374780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06520","last_updated":"2026-05-31T09:29:40Z","snapshot_observed_at":"2026-08-16T12:51:49.357503Z","submitted_at":"2025-03-09T08:48:51Z","title":"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement","version":3},"cited_work":{"arxiv_id":"2503.06520","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.06520","snapshot_observed_at":"2026-07-04T19:30:08.050016Z","title":"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement","venue":"cs.CV","work_id":"7a33b2a4-8409-4a00-ad7b-84e810df1ba7","year":2025},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"cited_paper":"/paper/2503.06520","citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:93fda08fc0f49677f738e8b2e3066dafd47d220d656679b988c13f7a84cf6a06","observation_id":"80303571-30e8-4450-9717-77803b3819d2","resolution":{"observed_at":"2026-05-20T05:28:05.247212Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visionreasoner: Unified reasoning-integrated visual perception via reinforcement learning","venue":null,"work_id":"293dd79b-1fc8-442f-b744-06d1c0636456","year":2026},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:9173f5a394ef017719a5324d64e86cb76e53e0e5064476cd716086b0ee12ded4","observation_id":"2dd39f48-4e75-447e-8bfd-b9b880995e5a","resolution":{"observed_at":"2026-05-20T05:43:25.429006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rsvp: Reasoning segmentation via visual prompting and multi-modal chain-of-thought","venue":null,"work_id":"b1d41bc8-12e7-4d0f-aa15-46433e277f7e","year":2025},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:b4501f0efd2bfb701ed0ea89c205dc8acedd8a48cbb23d9ba1bacde53fc7be4c","observation_id":"834d53f6-83ad-4dba-a2d5-c104decc2f56","resolution":{"observed_at":"2026-05-20T05:43:25.515127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T08:06:58.008462Z","title":"Image segmentation using text and image prompts","venue":null,"work_id":"a1828f63-125e-4b9e-8053-8fa1e79512eb","year":2022},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:db663aa218ae4d9ddd25b480787d6334fa2280beec1d62b4a6e730e0ebe8853a","observation_id":"a695338d-6c50-43dc-9a4c-ba3fb332c8df","resolution":{"observed_at":"2026-05-20T05:43:25.531600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Soc: Semantic-assisted object cluster for referring video object segmentation.Advances in Neural Information Processing Systems, pages 26425–26437","venue":null,"work_id":"dc0db7a1-38b1-4139-bda6-10e660f7de64","year":2023},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:993df66a082f26d8ce129e947e55dd8f295fbb951812791aef994e19d9743090","observation_id":"2c35af56-c239-48df-b971-b5e6e1a632ba","resolution":{"observed_at":"2026-05-20T05:43:25.463494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T15:02:40.804234Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":"2b5725a1-1d34-4510-a8e5-87b8a9a1c127","year":2016},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:f8bcf592f0f7d67386d03d81df044f90462bbcc828cec47f74e66e3859de87dc","observation_id":"b1a6f9c8-4336-4365-b003-6975ea7f4923","resolution":{"observed_at":"2026-05-20T05:43:25.370850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spectrum-guided multi-granularity referring video object segmentation","venue":null,"work_id":"8af63869-879f-4607-b06e-4cf69ba896aa","year":2023},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:990c7461502ef1366f13ecd511cea02bfcde120bc14952c4944a38152e530c42","observation_id":"672f137d-8739-46da-bae2-9a535781bb13","resolution":{"observed_at":"2026-05-20T05:48:05.333841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simple open- vocabulary object detection","venue":null,"work_id":"d2c53005-0d49-463d-9c19-42237396b1cd","year":2022},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:d75480f82d860a476dd3c386a42fbcb4dc7f6ef40e4b2e696d6feb8776ecfb43","observation_id":"1f66f7e8-060b-4b29-9689-8f660dfbf472","resolution":{"observed_at":"2026-05-20T05:43:25.497379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videoglamm: A large multimodal model for pixel-level visual grounding in videos","venue":null,"work_id":"d7cb0a33-dcba-42d6-a3be-12512aaeee38","year":2025},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:898cd5fc1730c530e56976349c163803d37cfee712a9a0fa222bd0f18a9f31f4","observation_id":"a67dd0cc-66af-40fc-b756-9ff5700963ab","resolution":{"observed_at":"2026-05-20T05:43:25.354382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Glamm: Pixel grounding large multimodal model","venue":null,"work_id":"b85c924c-cdc2-46ed-94df-dc678e1574bb","year":2024},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:9e7e1511e367581a57bd66c58677118a65c62e92951c6a8608bdf615ba96564c","observation_id":"3bc5c6b4-7b0c-4ab4-b1bc-54d25f6b324b","resolution":{"observed_at":"2026-05-20T05:48:05.323072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":"00a298c5-77d9-47fb-869b-ff469f490faf","year":2025},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:91c1d5464d752c147ba5925b88c3193a3332ed0b4c14cd40260f1bedce8d567a","observation_id":"e236a7b2-2272-4002-940f-2fe5098c548b","resolution":{"observed_at":"2026-05-20T05:48:05.314400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pixellm: Pixel reasoning with large multimodal model","venue":null,"work_id":"d5e443d8-2505-46b3-a2a3-d58d7896a8b0","year":2024},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:7badd3a3f0f67914b126377b88ec2d46c22de9731e55f2af6f495a038c7a19b8","observation_id":"0f35b2f6-cb35-4e32-83e4-828eb8f77faf","resolution":{"observed_at":"2026-05-20T05:48:05.309741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Urvos: Unified referring video object segmentation network with a large-scale benchmark","venue":null,"work_id":"c666cfee-6efb-4de5-983b-21b2e13b30bd","year":2020},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:cf7964d3c2d986fad8e64b4ad826d66a3c3777410cb866e7f023e6bdeea01531","observation_id":"bcd25cdd-85c4-4e87-b2c4-8fc166944435","resolution":{"observed_at":"2026-05-20T05:43:25.557239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-15T00:17:32.875866Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":"2601.03267","doi":"10.48550/arxiv.2601.03267","metadata_source":"pith","pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI GPT-5 System Card","venue":"cs.CL","work_id":"ca87689a-0d29-4476-b504-b65dbbb08af4","year":2025},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:1af6219cab4a583ee58569df19fd7880630e7d8d10eedf0e7bce04228933e6ca","observation_id":"234bfc0a-998d-41e6-87bc-17a797e80f6c","resolution":{"observed_at":"2026-05-20T05:28:05.225879Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-10T00:38:24.809631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T00:38:24.809631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":"2403.05530","doi":"10.48550/arxiv.2403.05530","metadata_source":"pith","pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":"cs.CL","work_id":"80e3e977-f1bb-4c83-8d0c-1ab0a0c5c3f1","year":2024},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:c714c2f895a9a7239709610820f992be69483560187e153bf19c9d23e7363bc0","observation_id":"20161db5-25b2-4471-800d-308692c2420a","resolution":{"observed_at":"2026-05-20T05:28:05.232614Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:14.426583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videoanydoor: High-fidelity video object insertion with precise motion control","venue":null,"work_id":"b558e96d-2804-4c48-8997-f83ab8f570db","year":2025},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:dbb64e8b8487fb7a02f453c4602c49b8a9db194e89ec819a469019fa3d297fa8","observation_id":"03943dfa-0224-4878-be9e-c5d863b2ab67","resolution":{"observed_at":"2026-05-20T05:43:25.380574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"X-sam: From segment anything to any segmentation","venue":null,"work_id":"dde42512-6dae-4d97-97e5-c5f4717fd71e","year":2026},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:128a3688ee5d4a585060197c7b9f91f06fb5aeb67dde18d7f7c61d4e87e74fd6","observation_id":"da2f5a62-fd98-47ae-b2f3-7f058730f80e","resolution":{"observed_at":"2026-05-20T05:43:25.519240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04107","last_updated":"2025-08-19T08:35:04Z","snapshot_observed_at":"2026-08-13T21:41:00.336361Z","submitted_at":"2025-08-06T06:06:52Z","title":"Unlocking the Potential of MLLMs in Referring Expression Segmentation via a Light-weight Mask Decoder","version":3},"cited_work":{"arxiv_id":"2508.04107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.04107","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unlocking the po- tential of mllms in referring expression segmentation via a light-weight mask decoder","venue":null,"work_id":"3d9b4c26-61d3-4434-8353-f3fc10b26162","year":2025},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"cited_paper":"/paper/2508.04107","citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:5be27b2a3d7634d3a077c8b220e83b2c1a2a1821d539277d0c8e7157925e1554","observation_id":"4d8528cd-c447-4f7c-ac86-a99839fa929f","resolution":{"observed_at":"2026-05-20T05:28:05.220398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Un- veiling parts beyond objects: Towards finer-granularity referring expression segmentation","venue":null,"work_id":"e941f128-9bf8-4a3a-a050-66733550dbd1","year":2024},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:c420c0ad4c88e86fdc67590a70d1ba839b65ea62d961deaf823103cefadd0ff5","observation_id":"7db59666-b6f0-46df-847c-40edae6a3cbf","resolution":{"observed_at":"2026-05-20T05:43:25.423872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.06139","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T00:07:42.278795Z","title":"Deforming videos to masks: Flow matching for referring video segmentation","venue":null,"work_id":"4f7a63d4-bfb7-46fa-b72f-f92458d9a85f","year":2025},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:28b0af77e62623f737074c2a74737846f5ae87b6d0687eb8e78918332a9a02d6","observation_id":"d7bbf721-287f-4ca6-a965-1586a5e4ff77","resolution":{"observed_at":"2026-05-20T05:28:05.254034Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hyperseg: Hybrid segmentation assistant with fine-grained visual perceiver","venue":null,"work_id":"4bf5879b-1bfa-4840-8f88-5e1a08810954","year":2025},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:e30e57569d689b45614a8b2e8ea1fda17574677ed2e0165ed5d02eb14cf03631","observation_id":"7be87b18-f613-439b-83b8-ec5a536e582d","resolution":{"observed_at":"2026-05-20T05:48:05.327341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instructseg: Unifying instructed visual segmentation with multi-modal large language models","venue":null,"work_id":"38681dfc-5d4f-49de-950c-04b903914ec2","year":2025},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:b10851165265a27eb3093c7e92a6463fe6a5e8cfba664ec0d33aecf625f7c839","observation_id":"a8279055-4d80-4130-8b67-e99c39476047","resolution":{"observed_at":"2026-05-20T05:48:05.340829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Onlinerefer: A simple online baseline for referring video object segmentation","venue":null,"work_id":"0b41ab1c-a04a-47ff-803c-b0c27ff9971c","year":2023},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:20aeaaf9590918296545760a4c08fa85ac8f8c8a0f1343d0a9832ecf668eb2a1","observation_id":"acfc1fc8-4642-44fb-afd1-a42dacd1d863","resolution":{"observed_at":"2026-05-20T05:48:05.336138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language as queries for referring video object segmentation","venue":null,"work_id":"8751b5f9-495e-49b1-a2b6-b210f4b77bcb","year":2022},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:44f44f3ac2f08fc4f6a9b1f681390889b1947bd4339606a6b3e57e1d7581f4c5","observation_id":"f4e5db51-586b-4f44-b5b5-598e4646e75b","resolution":{"observed_at":"2026-05-20T05:43:25.393762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"General object foundation model for images and videos at scale","venue":null,"work_id":"ae632fb8-eb3c-4d9d-851f-5e4a32fea2c6","year":2024},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:8c551aaade1ef59aec64d91d55f871a131d4965baf809b6daf897b797a220106","observation_id":"116540d0-c105-4183-be42-9e954e2d362e","resolution":{"observed_at":"2026-05-20T05:43:25.461913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gsva: Generalized segmentation via multimodal large language models","venue":null,"work_id":"08a1add6-b03a-46e8-91ca-efdd686b22d8","year":2024},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:056bf037981e19f0c724c9820e7bf9473144e7a3271bc2cb3a70ad78a09f2e3c","observation_id":"df6a6a94-570c-478d-8ca7-9a71c2f48965","resolution":{"observed_at":"2026-05-20T05:43:25.457593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Region-based cluster discrimination for visual representation learning","venue":null,"work_id":"5af920bd-f48f-4370-9885-3922a0db4264","year":2025},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:387ac4b027bf89134d635cde5d90627ba4f5ac0de8ba5b4fc4f34b2952f12674","observation_id":"76775ba7-cdcd-4bd6-bb84-777c3a63fb9a","resolution":{"observed_at":"2026-05-20T05:43:25.319424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Viddar: Vision language model-based task-detrimental content detection for augmented reality.IEEE transactions on visualization and computer graphics","venue":null,"work_id":"c5c9ef16-9dbe-491c-bd9b-7ced43578f50","year":2025},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:fc61a9f0c9023f79b62a940b5b71b5ca6f09cb67187c97972e37a3e6beda67d9","observation_id":"62034e00-7601-49b4-bf7a-e811216db534","resolution":{"observed_at":"2026-05-20T05:43:25.570131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visa: Reasoning video object segmentation via large language models","venue":null,"work_id":"44a9f1c7-cf5c-4f42-b300-56e2f8882206","year":2024},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:6b4343daaafa042eb29a31b08c2a6e77b85a2ebc834a899dc4bccf0e529dd05b","observation_id":"9546c80c-1e60-47b5-8233-748e50e06bb4","resolution":{"observed_at":"2026-05-20T05:43:25.510040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lavt: Language- aware vision transformer for referring image segmentation","venue":null,"work_id":"81fc8c2f-8aef-4fff-92d4-ebb60f0b2a40","year":2022},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:99702b25bb5c8a75d46ce800678a1d1cfc85839c8a097567fb2568effd1b384d","observation_id":"81062f97-ad17-4ed4-8ca4-92d2b11d0419","resolution":{"observed_at":"2026-05-20T05:43:25.323410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mattnet: Modular attention network for referring expression comprehension","venue":null,"work_id":"f39391a0-51ff-4a75-91ac-337552568874","year":2018},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:9d39df6b9ceec74fef027e6ef0c4b883f9897029137537dfe12b94361967bb8f","observation_id":"16ae8d62-a0a5-4cce-80f9-7d80c41808cc","resolution":{"observed_at":"2026-05-20T05:48:05.320645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-08-16T10:23:40.545862Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"cited_work":{"arxiv_id":"2501.04001","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.04001","snapshot_observed_at":"2026-07-10T03:06:43.598138Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","venue":"cs.CV","work_id":"fbffda10-106c-432c-b84e-5d0908666921","year":2025},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"cited_paper":"/paper/2501.04001","citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:d9877b3a87a7260b26ef69b5ab697fd540d08be26f43d07769f34b22747b4810","observation_id":"52b6c867-b539-4fce-9dd7-63f49708b868","resolution":{"observed_at":"2026-05-20T05:28:05.189889Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Omg-llava: Bridging image-level, object-level, pixel-level reasoning and understanding","venue":null,"work_id":"01612bfa-7f4c-49c3-a62d-019e7075198a","year":2024},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:47ca32a09c01484bd8cd1de4d68fa6c14b0b90a3d9134503d1317c01bb2e18dd","observation_id":"fcc88c27-156d-444c-ae29-fa6c9f709434","resolution":{"observed_at":"2026-05-20T05:43:25.439311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-16T13:38:39.890570Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":"2406.20076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-07-10T08:06:57.772386Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":"cs.CV","work_id":"9c74bfe1-f3f0-49c7-b929-3627d1d4fc12","year":2024},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:fd4508553a61899bcae6462b77d01db2a2153a3820ac68c9ab434752049b3cc4","observation_id":"c36a9fb7-f75a-4e05-bf97-86dff3564869","resolution":{"observed_at":"2026-05-20T05:28:05.240709Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Psalm: Pixelwise segmentation with large multi-modal model","venue":null,"work_id":"aad2d8d0-787c-4586-9b6d-7c6e1d2e8157","year":2024},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:9d10b8346e1bb31f355af37626cfbed580f26e38cdc0f4512a6549fcbf24ca00","observation_id":"13afa7f0-fe46-441f-a54b-7d2a3ca7572f","resolution":{"observed_at":"2026-05-20T05:48:05.318635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sec: Advancing complex video object segmentation via progressive concept construction","venue":null,"work_id":"cb50bed2-3bb4-43d8-9936-2c7216813ae1","year":2026},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:70d7582a0e2a90d8393c5a25fdd3b864472e0a9440a97372076fba0dc1833cbd","observation_id":"349c8681-0bb2-4139-93a2-95bbafd5d4c2","resolution":{"observed_at":"2026-05-20T05:48:05.325321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Villa: Video reasoning segmentation with large language model","venue":null,"work_id":"e571cf74-9c16-4e89-8527-2fcc650ecaef","year":2025},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:5f0b2284c77703137f8448d8b18b2c9265b7d9eba5c9b16d61688699c31484b3","observation_id":"4e0a5877-bd1d-43d9-bcf8-1291b17b8e2a","resolution":{"observed_at":"2026-05-20T05:48:05.316618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Regionclip: Region-based language-image pretraining","venue":null,"work_id":"f61d636f-cc6c-406b-8519-dd988e17650c","year":2022},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:286d172b5d0034fe44388360f91bc74f95c1a0804e11c414d36e0b57e2582d12","observation_id":"e058cb1e-2a8c-41ea-9554-3320c1480a85","resolution":{"observed_at":"2026-05-20T05:43:25.384599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17448","last_updated":"2023-12-29T03:22:18Z","snapshot_observed_at":"2026-08-16T19:27:12.958832Z","submitted_at":"2023-12-29T03:22:18Z","title":"Tracking with Human-Intent Reasoning","version":1},"cited_work":{"arxiv_id":"2312.17448","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.17448","snapshot_observed_at":"2026-07-04T19:30:08.023877Z","title":"Tracking with human-intent reasoning","venue":null,"work_id":"788a5f4b-7758-48e1-aac9-a58e36424396","year":2023},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"cited_paper":"/paper/2312.17448","citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:8b61e2b39a73aff0b6189ce7fe01f8a40ea35f847412532b8ef03d0e5d4c70e1","observation_id":"d47a6581-3349-4eb0-85c8-2920f6ea51b3","resolution":{"observed_at":"2026-05-20T05:28:05.184646Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training-free spatio-temporal decoupled reasoning video segmentation with adaptive object memory","venue":null,"work_id":"e9fcf4d1-b81c-4d8b-af12-bb35a70e3942","year":2026},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:4cb485ca002b6494a75a4cd3bb5c7cf35aa62ca6a32b1a18d4722a46eb9f8b55","observation_id":"55fdb31c-232f-46e5-88c3-99b24d8d29c3","resolution":{"observed_at":"2026-05-20T05:48:05.329461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":"7a74bb19-5388-44c7-8480-45ea5884abc2","year":2023},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:d487611080fd8902854951c5686bb08fd32785806168d84e172236317ace011e","observation_id":"f98126f4-41db-4573-9b9c-a300445a68e5","resolution":{"observed_at":"2026-05-20T05:43:25.456728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generalized decoding for pixel, image, and language","venue":null,"work_id":"11b41038-76bf-4784-85c2-83a30de670c9","year":2023},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:38ba3deee364fc81772ba74c9533930486634999f6c2c00350b0da817d7b08a5","observation_id":"3c562250-8c72-4648-85d5-acefb3f00ea9","resolution":{"observed_at":"2026-05-20T05:43:25.480873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segment everything everywhere all at once.Advances in neural information processing systems, 36:19769–19782","venue":null,"work_id":"65bc4d7f-6db0-47fc-b68f-9330cf42380d","year":2023},"citing_paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-20T05:23:32.202297Z"},"links":{"citing_paper":"/paper/2605.20110"},"observation_digest":"sha256:c69ff9230e5d9d4f37e806d96915402590135ff05d8109adb5618c9eaa7b439a","observation_id":"e6957b40-145e-4170-95a5-3e24172a1587","resolution":{"observed_at":"2026-05-20T05:43:25.434250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.20110","last_updated":"2026-05-19T16:59:11Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T14:33:06.575247Z","submitted_at":"2026-05-19T16:59:11Z","title":"SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":9,"verified_fuzzy":68},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 2 inbound Pith citation observations for arXiv:2605.20110."}