{"as_of":"2026-08-08T13:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4f2b5f8155db4f480fa1417c67e20e80b52b45eb5134b0d92553a147f4264577","coverage":[{"denominator":114,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:27:18.789405Z","state":"measured"},{"denominator":105,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":105,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:06:22.967237Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:55.361578Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18816","snapshot_observed_at":"2026-08-06T15:06:22.967237Z","title":"Reasoning segmentation for images and videos: A survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16718","last_updated":"2025-07-22T15:59:21Z","snapshot_observed_at":"2026-08-07T21:27:05.839553Z","submitted_at":"2025-07-22T15:59:21Z","title":"Temporally-Constrained Video Reasoning Segmentation and Automated Benchmark Construction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:06:22.967237Z"},"links":{"cited_paper":"/paper/2505.18816","citing_paper":"/paper/2507.16718"},"observation_digest":"sha256:10ecc596b133c5f602e9f620154c71d778c158dbd3810e4c16f0d9c96adcafec","observation_id":"6507a37d-5882-44da-844d-3acb78c39a8e","resolution":{"observed_at":"2026-08-06T15:06:22.967237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"cited_work":{"arxiv_id":"2505.18816","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18816","snapshot_observed_at":"2026-07-04T15:09:55.361578Z","title":"Reasoning segmentation for images and videos: A survey,","venue":null,"work_id":"0447ba5c-64a6-4019-9adf-5c1fb1c58f6f","year":2025},"citing_paper":{"arxiv_id":"2604.12315","last_updated":"2026-04-14T05:45:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T05:45:55Z","title":"GTPBD-MM: A Global Terraced Parcel and Boundary Dataset with Multi-Modality","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T15:54:29.027805Z"},"links":{"cited_paper":"/paper/2505.18816","citing_paper":"/paper/2604.12315"},"observation_digest":"sha256:04e7d2abd7e504ace75f3f5d8043f8ea5d3b49d5a4b20eb598db9c80b78363e1","observation_id":"8dba12a3-d13f-4f62-8e1e-4ff91d86e7a5","resolution":{"observed_at":"2026-05-11T09:41:00.225117Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"cited_work":{"arxiv_id":"2505.18816","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18816","snapshot_observed_at":"2026-07-04T15:09:55.361578Z","title":"Reasoning segmentation for images and videos: A survey,","venue":null,"work_id":"0447ba5c-64a6-4019-9adf-5c1fb1c58f6f","year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"cited_paper":"/paper/2505.18816","citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:d43acf90b9ebc44ff2111d3623510c2e21cdf17e6bfff5c2923750f93317a651","observation_id":"99dbdaa5-f54f-43cb-989b-8cf35a603dd1","resolution":{"observed_at":"2026-07-01T20:46:14.156308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"cited_work":{"arxiv_id":"2505.18816","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18816","snapshot_observed_at":"2026-07-04T15:09:55.361578Z","title":"Reasoning segmentation for images and videos: A survey,","venue":null,"work_id":"0447ba5c-64a6-4019-9adf-5c1fb1c58f6f","year":2025},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2505.18816","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:e09a789fe99ac1f3b5375b045d9250a44eefa422a1978d37395d4d1c4bff4576","observation_id":"faaf51be-153a-4a61-9ba3-1c7b12e6a4a4","resolution":{"observed_at":"2026-07-04T15:09:55.363471Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18816","snapshot_observed_at":"2026-07-11T13:38:03.546834Z","title":"arXiv preprint arXiv:2505.18816 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04779","last_updated":"2026-07-06T08:10:03Z","snapshot_observed_at":"2026-08-07T06:02:30.993952Z","submitted_at":"2026-07-06T08:10:03Z","title":"DGSeg: Dynamic Gating of Semantic-Spatial Guided Predictions for Reasoning Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-11T13:38:03.546834Z"},"links":{"cited_paper":"/paper/2505.18816","citing_paper":"/paper/2607.04779"},"observation_digest":"sha256:9fe6c78df42890e93649771f079873b33fc65129706f16f69742a878ce8aa82f","observation_id":"b5da47c9-260f-41ab-9dba-72e58d18e44a","resolution":{"observed_at":"2026-07-11T13:38:03.546834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18816/citation-record","integrity":"/paper/2505.18816/integrity","json":"/paper/2505.18816/citation-record.json","paper":"/paper/2505.18816"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1709.03450","last_updated":"2017-09-11T15:50:24Z","snapshot_observed_at":"2026-08-07T21:59:34.022192Z","submitted_at":"2017-09-11T15:50:24Z","title":"UI-Net: Interactive Artificial Neural Networks for Iterative Image Segmentation Based on a User Model","version":1},"cited_work":{"arxiv_id":"1709.03450","doi":null,"metadata_source":"pith","pith_arxiv_id":"1709.03450","snapshot_observed_at":"2026-08-07T14:27:20.268447Z","title":"UI-Net: Interactive Artificial Neural Networks for Iterative Image Segmentation Based on a User Model","venue":"cs.CV","work_id":"21188c50-5634-405e-b75c-f93cee7bb8fa","year":2017},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:11.018222Z"},"links":{"cited_paper":"/paper/1709.03450","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:39bf7b2160024dde46293ec685ea0c58f419ed5eab598f027c91964562a85f35","observation_id":"2535e581-f34c-49aa-a4cd-90ff023a2e52","resolution":{"observed_at":"2026-08-07T14:27:20.276725Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09754","last_updated":"2025-04-03T14:52:24Z","snapshot_observed_at":"2026-08-06T09:15:37.141672Z","submitted_at":"2024-12-12T23:10:54Z","title":"ViCaS: A Dataset for Combining Holistic and Pixel-level Video Understanding using Captions with Grounded Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09754","snapshot_observed_at":"2026-08-07T14:27:11.072412Z","title":"Vicas: A dataset for combining holistic and pixel-level video understanding using captions with grounded segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:11.072412Z"},"links":{"cited_paper":"/paper/2412.09754","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:eaeb23922a32c665b4ead73409455654e0baa503f07576c46835adfda55cd298","observation_id":"5104d3b1-8a63-48c0-bd05-b019af82bf66","resolution":{"observed_at":"2026-08-07T14:27:11.072412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:11.134478Z","title":"Burst: A benchmark for unifying object recognition, 39 segmentation and tracking in video, in: Proceedings of the IEEE/CVF winter conference on applications of computer vision, pp","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:11.134478Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:9767ebcdfd0e420565a3dbba96718cc831763e856ed4c1eff4c40e5a84ad3ab4","observation_id":"5628c86b-4642-451e-80ca-aa9b60782db4","resolution":{"observed_at":"2026-08-07T14:27:11.134478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19603","last_updated":"2024-09-29T07:47:15Z","snapshot_observed_at":"2026-07-06T19:24:03.133851Z","submitted_at":"2024-09-29T07:47:15Z","title":"One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19603","snapshot_observed_at":"2026-08-07T14:27:11.218146Z","title":"One token to seg them all: Language instructed reasoning segmentation in videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:11.218146Z"},"links":{"cited_paper":"/paper/2409.19603","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:9d3de62eb2e7a54b893200e550fadb9381944089f88cb9dfaeb9856d2f6df671","observation_id":"1596bf16-837f-4dc4-bc2f-653d81fd4952","resolution":{"observed_at":"2026-08-07T14:27:11.218146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:11.273826Z","title":"Cores: Orchestrating the dance of reasoning and segmentation, in: European Conference on Computer Vision, Springer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:11.273826Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:3ff0e077247b12ccefd5cf3bba193733c345713c5f35dd2ad3665fc41219c293","observation_id":"98bc1725-92aa-476a-a66b-6da70b393a0b","resolution":{"observed_at":"2026-08-07T14:27:11.273826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:11.329047Z","title":"Xmem++: Production-level video segmentation from few annotated frames, in: Pro- ceedings of the IEEE/CVF International Conference on Computer Vision, pp","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:11.329047Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:62970f562fa168ea3ed0c61e1cd751824d20a4ff1442c74cc66964d3646e1306","observation_id":"f2799ce2-0ec9-4498-aadb-2f0dd8d18212","resolution":{"observed_at":"2026-08-07T14:27:11.329047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:11.431803Z","title":"Coco-stuff: Thing and stuff classes in context, in: Proceedings of the IEEE conference on computer vision and pattern recognition, pp","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:11.431803Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:278990024c08d486803534381735749eeb1dabbcd0851ec7a2553d9912b18063","observation_id":"3e7199cf-1e6b-407e-b00d-f1c96ac9424c","resolution":{"observed_at":"2026-08-07T14:27:11.431803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:11.489319Z","title":"Coco-stuff: Thing and stuff classes in context, in: Proceedings of the IEEE conference on computer vision and pattern recognition, pp","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:11.489319Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:18709513a5719b48d29c50b7d25d6c0d693732f93f68ffefc969f704124bc9bc","observation_id":"54b9c109-2a0d-4591-b8e9-1cb2d4b7aada","resolution":{"observed_at":"2026-08-07T14:27:11.489319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09447","last_updated":"2025-02-13T16:16:54Z","snapshot_observed_at":"2026-08-07T21:24:04.493867Z","submitted_at":"2025-02-13T16:16:54Z","title":"Pixel-Level Reasoning Segmentation via Multi-turn Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09447","snapshot_observed_at":"2026-08-07T14:27:11.587733Z","title":"Pixel-level reasoning segmentation via multi-turn conversations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:11.587733Z"},"links":{"cited_paper":"/paper/2502.09447","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:a8c493207df54c57f513620e6c510dfb66b4e491e1a9cd6e38a9ec5001c4f165","observation_id":"f732ecc8-2281-48dc-9fa4-6ee936b81096","resolution":{"observed_at":"2026-08-07T14:27:11.587733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:11.653276Z","title":"End-to-end object detection with transformers, in: European conference on computer vision, Springer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:11.653276Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:6803182d0d2a3bd281bd71cf81f3900de2ec08dd2c1643521db3dd821d0b9a0d","observation_id":"a2672107-2874-4dd1-9b28-4eb09fc36747","resolution":{"observed_at":"2026-08-07T14:27:11.653276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:11.754067Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:11.754067Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:9c9a2504cc13897c3e585b6b8812fc5521d38ed57a459dd2a89e015c557bd73f","observation_id":"9c17b8da-d672-4c2d-8dcf-003f75f2aa62","resolution":{"observed_at":"2026-08-07T14:27:11.754067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:11.868491Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:11.868491Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:df6d4340df7e1b393e53f3f875696fb462786527f0fa4a6ad3339099cdc0d510","observation_id":"0cf067c6-6e1d-49e2-b69c-d469484d8642","resolution":{"observed_at":"2026-08-07T14:27:11.868491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:11.942872Z","title":"Sam4mllm: Enhance multi-modal large language model for referring ex- pression segmentation, in: European Conference on Computer Vision, Springer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:11.942872Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:a037aaf677e6968443a952b0e6493b01405152c75f3d1b8b22a70d8ff9470017","observation_id":"0023a925-9097-4578-b971-51f60d688532","resolution":{"observed_at":"2026-08-07T14:27:11.942872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:11.987613Z","title":"Masked-attention mask transformer for universal image segmentation, in: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pp","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:11.987613Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:9fedc7cdca8361a6972eab4afa6176578d7fd9319973618fc0d49068cf9cfdb0","observation_id":"4250dca0-38ea-4da1-bb92-80a94ba49762","resolution":{"observed_at":"2026-08-07T14:27:11.987613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:12.062712Z","title":"Xmem: Long-term video object seg- mentation with an atkinson-shiffrin memory model, in: European Confer- ence on Computer Vision, Springer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:12.062712Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:7f646ad1ead1552de1eca6f6d9fe5e0322613881496bb79ec7e0009f2afcd2a0","observation_id":"1ed77509-9ee5-4d18-adb0-fd733b49b0dc","resolution":{"observed_at":"2026-08-07T14:27:12.062712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:12.140729Z","title":"Vocabulary-free image classification","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:12.140729Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:819a89652b71f30b28140753d02145f060fb1052d41c5df40d79b58a261749eb","observation_id":"47fd545a-b396-4222-bb23-690101e7ba9a","resolution":{"observed_at":"2026-08-07T14:27:12.140729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:12.225657Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes, in: Proceedings of the IEEE conference on computer vision and pattern recognition, pp","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:12.225657Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:8452c6f4925e753a3011807184da1013905a50859f928e4ea970132d96c31d40","observation_id":"cf1d2c9b-d29f-4510-bfab-118019625441","resolution":{"observed_at":"2026-08-07T14:27:12.225657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:12.305165Z","title":"Tao: A large-scale benchmark for tracking any object, in: Computer Vision–ECCV 2020: 16th European Conference, Glasgow, UK, August 23–28, 2020, Proceedings, Part V 16, Springer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:12.305165Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:0efcaea0c1d172b7ca7171897f9cbccb235e9ee6f579589cfdc0ea73a5ffb889","observation_id":"e90944a5-7290-4d20-87f3-5469fca853cc","resolution":{"observed_at":"2026-08-07T14:27:12.305165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09921","last_updated":"2025-04-04T03:20:03Z","snapshot_observed_at":"2026-07-06T19:50:42.251149Z","submitted_at":"2024-11-15T03:45:09Z","title":"Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel Level","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09921","snapshot_observed_at":"2026-08-07T14:27:12.401764Z","title":"Motion-grounded video reasoning: Understanding and perceiving motion at pixel level","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:12.401764Z"},"links":{"cited_paper":"/paper/2411.09921","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:3bed1602d7587d507479b9d9cba032d2e29e65d9c74948986c30714c13ac5b44","observation_id":"82302091-de9e-46e9-bae2-48fc6dbb0626","resolution":{"observed_at":"2026-08-07T14:27:12.401764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:12.500258Z","title":"Mevis: A large-scale benchmark for video segmentation with motion expressions, in: Proceed- ings of the IEEE/CVF International Conference on Computer Vision, pp","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:12.500258Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:abd8213544860c4ab2b2b5ec8a75ea914b157b6b5da329215545b90087b73baf","observation_id":"a4b13401-579b-4aad-ac1a-9744ffa96064","resolution":{"observed_at":"2026-08-07T14:27:12.500258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:12.592565Z","title":"Mose: A new dataset for video object segmentation in complex scenes, in: Pro- ceedings of the IEEE/CVF international conference on computer vision, pp","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:12.592565Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:c683ca1f5f0c014ad7e27e7cde7496da5b4bfd014330b4062e82e50643678ce6","observation_id":"783e111d-b744-4e99-b275-4ac4768809cb","resolution":{"observed_at":"2026-08-07T14:27:12.592565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.10250","last_updated":"2021-11-19T14:40:24Z","snapshot_observed_at":"2026-07-06T12:10:13.301883Z","submitted_at":"2021-11-19T14:40:24Z","title":"Panoptic Segmentation: A Review","version":1},"cited_work":{"arxiv_id":"2111.10250","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.10250","snapshot_observed_at":"2026-08-07T14:27:20.227710Z","title":"Panoptic Segmentation: A Review","venue":"cs.CV","work_id":"9d17cda7-28d1-4972-b8b8-0fc92fbde6b2","year":2021},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:12.659787Z"},"links":{"cited_paper":"/paper/2111.10250","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:984bf42f43beb57443a8b6234aeb240356f356377ddfa4cd3ca69c35df957b80","observation_id":"579de55c-4d1f-4f10-b152-c97f38c742c9","resolution":{"observed_at":"2026-08-07T14:27:20.231845Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:12.718042Z","title":"Oops! predicting unintentional action in video, in: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pp","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:12.718042Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:0eb9bca000d5f425ce2b136a2f481206707326bc2b81b94fda6cae312553aaa3","observation_id":"bcf025c8-490b-4b28-b496-4f577043241f","resolution":{"observed_at":"2026-08-07T14:27:12.718042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01105","last_updated":"2024-09-05T03:38:08Z","snapshot_observed_at":"2026-07-06T17:24:03.237617Z","submitted_at":"2024-02-02T02:44:59Z","title":"A Survey for Foundation Models in Autonomous Driving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01105","snapshot_observed_at":"2026-08-07T14:27:12.818555Z","title":"A survey for foundation models in autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:12.818555Z"},"links":{"cited_paper":"/paper/2402.01105","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:e86934a3f1caabce3a492f3227b71366961505fec1dc24a0469f0624fc4dc33a","observation_id":"56a0ce34-9da4-4754-8128-2335acf07537","resolution":{"observed_at":"2026-08-07T14:27:12.818555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:12.927968Z","title":"Part- aware panoptic segmentation, in: Proceedings of the IEEE/CVF Confer- ence on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:12.927968Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:25be33ab7f13234283a93ed1d9633d0e5cfa04461178e9f0bbb2d7ee389d8afb","observation_id":"abe7de4f-a2cf-4111-ac9e-f8fe5fd37ed8","resolution":{"observed_at":"2026-08-07T14:27:12.927968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08549","last_updated":"2025-01-15T03:17:24Z","snapshot_observed_at":"2026-07-06T20:21:13.914417Z","submitted_at":"2025-01-15T03:17:24Z","title":"The Devil is in Temporal Token: High Quality Video Reasoning Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08549","snapshot_observed_at":"2026-08-07T14:27:13.039735Z","title":"The devil is in temporal token: High quality video reasoning segmentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:13.039735Z"},"links":{"cited_paper":"/paper/2501.08549","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:6297dd7145ad28533be7ef0f8c934ebb419e0ff7d52049605ba5b22951260d57","observation_id":"770e0673-4881-4b20-abde-e9f044696652","resolution":{"observed_at":"2026-08-07T14:27:13.039735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:13.120490Z","title":"The iapr tc-12 benchmark: A new evaluation resource for visual information systems, in: International workshop ontoImage, pp","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:13.120490Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:55429efb3dad44fde6430fcb434e84911d394f2ded44bc84e76a335009a971c1","observation_id":"d3443753-da5e-48db-b968-d39eaebd1a60","resolution":{"observed_at":"2026-08-07T14:27:13.120490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:13.222976Z","title":"Lvis: A dataset for large vocabu- lary instance segmentation, in: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pp","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:13.222976Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:e790278eedd46093716ef67c31523989a7d98606f4495eb89cb6109f400dbf80","observation_id":"b0496995-8774-403f-a4dd-cde1f9e7a271","resolution":{"observed_at":"2026-08-07T14:27:13.222976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:13.329467Z","title":"A survey on instance segmentation: state of the art","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:13.329467Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:e0ac920a1bbe9bc317abfcf931d6bb52915f93dcf93e0b77817e485c1ec0c8a2","observation_id":"3b31db6e-4004-49a0-9ed4-73dddcf0523d","resolution":{"observed_at":"2026-08-07T14:27:13.329467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:13.453671Z","title":"A brief survey on semantic segmentation with deep learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:13.453671Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:5db4c9fb4ddb3d138fafbd55fa67f4178d26395fd39e0cb1c6eb4a61f9a83389","observation_id":"99f2b6af-40a8-4263-8878-38917cb669dd","resolution":{"observed_at":"2026-08-07T14:27:13.453671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T14:27:13.560190Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:13.560190Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:e7e30254402c1d098c1b96847c50cacf14e1c6df2bdaf18eb5698a4236883082","observation_id":"c2a94a13-f9d0-4335-aa48-30e7e1af3941","resolution":{"observed_at":"2026-08-07T14:27:13.560190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:13.682259Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:13.682259Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:4afabd5466f054e8bf1cd33536f406ffccc4d4290d43808f7d3546eccdb79ee9","observation_id":"8ff5aa0d-221e-4702-92d0-32ff4c5ba8a4","resolution":{"observed_at":"2026-08-07T14:27:13.682259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13881","last_updated":"2025-03-18T04:23:09Z","snapshot_observed_at":"2026-08-07T16:56:00.215424Z","submitted_at":"2025-03-18T04:23:09Z","title":"MMR: A Large-scale Benchmark Dataset for Multi-target and Multi-granularity Reasoning Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13881","snapshot_observed_at":"2026-08-07T14:27:13.729538Z","title":"Mmr: A large- scale benchmark dataset for multi-target and multi-granularity reasoning segmentation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:13.729538Z"},"links":{"cited_paper":"/paper/2503.13881","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:6ed16ef44aecf414552e9540dcdcb192ef258fe39f2226adcc91d2321ba497e5","observation_id":"d3d0aa40-7f13-4279-b0aa-637e14b53d26","resolution":{"observed_at":"2026-08-07T14:27:13.729538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:13.814778Z","title":"Referitgame: Referring to objects in photographs of natural scenes, in: Proceedings of the 2014 conference on empirical methods in natural language processing (EMNLP), pp","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:13.814778Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:586fd25b8556c9b1ca6ff608736a264406e7d1e942997d1299a220c3ed24e8dc","observation_id":"253e3da3-74e8-4901-9f12-5f9800cc4d08","resolution":{"observed_at":"2026-08-07T14:27:13.814778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:13.880321Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:13.880321Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:337db890e37a0fad2d47f50b040e827cad8d73009a159452a8c66ec807bd8426","observation_id":"e889dbfc-6c15-40ee-b6c1-ad95c4e89f14","resolution":{"observed_at":"2026-08-07T14:27:13.880321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:14.033054Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:14.033054Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:73ede327c12a5d14f16da2deb99a6e09b18c9130d250c6a18e8f7e834f4b86a8","observation_id":"21a0058f-f297-4cf8-8f18-d9b02ba6c83c","resolution":{"observed_at":"2026-08-07T14:27:14.033054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-07T14:27:14.085972Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:14.085972Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:e012121eed721c62ca6cbde4f6cb845112cf03ce86419fa014b991ad387900c0","observation_id":"9bdf61cd-b914-4ae6-9b78-ede9ac9bb40a","resolution":{"observed_at":"2026-08-07T14:27:14.085972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:14.115774Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annota- tions","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:14.115774Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:6343d7be093eb9e2fc83aec8886bd06594a2435be0d7cb5e2c3e25ff43c6525c","observation_id":"35d9f209-ff49-4b67-aded-df2dbded454b","resolution":{"observed_at":"2026-08-07T14:27:14.115774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:14.277333Z","title":"The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:14.277333Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:44e0a9b2e71ddcc42e7590cecc4f402eb354fc2ef46d271f0fc29e7e201b3e61","observation_id":"07e0de33-8137-44ee-ba4c-eb01420f4378","resolution":{"observed_at":"2026-08-07T14:27:14.277333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:14.380393Z","title":"Lisa: Reasoning segmentation via large language model, in: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:14.380393Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:039fc13e305b4ad2074d33335fa6da79dc325e7908b635b031e1c5bd08e12c52","observation_id":"c4177e72-78d3-4531-aaf8-79acb0d3d0d0","resolution":{"observed_at":"2026-08-07T14:27:14.380393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:14.526975Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language mod- els, in: International conference on machine learning, PMLR","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:14.526975Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:1b341b29c359296015c27bc4a8dfdebd1ac29ad79e60375ef795d193dbb21158","observation_id":"31641866-bf98-47f1-9203-f901a609f30f","resolution":{"observed_at":"2026-08-07T14:27:14.526975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09644","last_updated":"2025-04-13T16:36:47Z","snapshot_observed_at":"2026-08-07T16:06:07.544996Z","submitted_at":"2025-04-13T16:36:47Z","title":"SegEarth-R1: Geospatial Pixel Reasoning via Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09644","snapshot_observed_at":"2026-08-07T14:27:14.624387Z","title":"Segearth-r1: Geospatial pixel reasoning via large language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:14.624387Z"},"links":{"cited_paper":"/paper/2504.09644","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:16a07f4e0bca1586bef974c8961b7debe30726b0aa27a4d079e0875be3ab2a37","observation_id":"a8b427f1-981a-4b88-9931-54c2b2ae607d","resolution":{"observed_at":"2026-08-07T14:27:14.624387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:14.796318Z","title":"Robust referring video object segmentation with cyclic structural consensus, in: Proceed- ings of the IEEE/CVF International Conference on Computer Vision, pp","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:14.796318Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:f4e22cc4d6608574a8f43981973a17724a8e7ef44dca44150ee4e0dfca8a4b99","observation_id":"b28ed6f8-e70a-43ca-aa56-40198daea904","resolution":{"observed_at":"2026-08-07T14:27:14.796318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:14.946198Z","title":"Llama-vid: An image is worth 2 tokens in large language models, in: European Conference on Computer Vision, Springer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:14.946198Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:fb82edf5ca4ba879d98a527d857ae97f1847beaedcd1832a10a11268f11e2de0","observation_id":"ebc5c99f-5a2a-488f-b500-da0ab41c0c1b","resolution":{"observed_at":"2026-08-07T14:27:14.946198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.657836Z","title":"Microsoft coco: Common objects in context, in: Computer Vision–ECCV 2014: 13th European Confer- ence, Zurich, Switzerland, September 6-12, 2014, Proceedings, Part V 13, Springer","venue":null,"work_id":"ba33abdb-a574-411f-b3f2-ec145f811acd","year":2014},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:15.084904Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:735ebdad4fa9181ece5594f45633a83f23c034b46436c548bfee845ca1c3d4ac","observation_id":"3b393a59-01d6-491b-9e1f-1e25d2744064","resolution":{"observed_at":"2026-08-07T14:27:20.661879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.649064Z","title":"Gres: Generalized referring expression segmentation, in: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pp","venue":null,"work_id":"3e6888b0-e8c8-44cf-ad98-4488fe8cbf7d","year":2023},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:15.241954Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:063aa1e558e5b769a4846483e18650381db93d48b929290d35b5801077e23514","observation_id":"9b0163e8-9b0b-48eb-ba6a-16065bb2e529","resolution":{"observed_at":"2026-08-07T14:27:20.653225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.640165Z","title":"Visual instruction tuning","venue":null,"work_id":"4846d29f-ae55-4110-b96b-b08f06fcb91d","year":2024},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:15.352155Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:b12241c22eff8599b815668869dfb403cb0592c1a2aef204bd8905fca34bfe6d","observation_id":"09a281c4-b093-437f-84cf-ce514a7497c9","resolution":{"observed_at":"2026-08-07T14:27:20.643861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06520","last_updated":"2026-05-31T09:29:40Z","snapshot_observed_at":"2026-08-07T17:19:13.101842Z","submitted_at":"2025-03-09T08:48:51Z","title":"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06520","snapshot_observed_at":"2026-08-07T14:27:15.482347Z","title":"Seg- zero: Reasoning-chain guided segmentation via cognitive reinforcement","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:15.482347Z"},"links":{"cited_paper":"/paper/2503.06520","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:dffbdf764c825bca3df807eaa590ac7ddea84796e4b50e8dc1c95d1c57fc430f","observation_id":"17fd4db2-02f2-476e-a215-7c8d40dae819","resolution":{"observed_at":"2026-08-07T14:27:15.482347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.632164Z","title":"Ground abstract structure concepts of scaffolding systems for automatic compliance check- ing based on reasoning segmentation","venue":null,"work_id":"702cc653-c54b-465c-8125-a1690aea01f0","year":2025},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:15.625060Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:517c8371ab1c8e1bf12d989636bc048dcf69cd149f2980dd47858ada8bf5e652","observation_id":"af282039-22b4-42fe-8e33-9d88f65ff8df","resolution":{"observed_at":"2026-08-07T14:27:20.635044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.624147Z","title":"Video anomaly detection and explanation via large language models","venue":null,"work_id":"5697fd89-2164-4d28-86b5-e31f3f23b8a5","year":2024},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:15.763488Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:a3d80fade57590629bc305f5856db216fb3e7b0b40744a1a5f9cac5b44f64e36","observation_id":"e6c3dddf-c8cf-49f0-8e4d-304427d957a7","resolution":{"observed_at":"2026-08-07T14:27:20.627054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-07T14:27:15.874035Z","title":"Video-chatgpt: To- wards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:15.874035Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:d8704616451ea40dff81979cb823e90929c65e4a03cdb09dc86492b6ff7659d6","observation_id":"dc0c66bc-dbca-49f9-9a4f-6239e505fd84","resolution":{"observed_at":"2026-08-07T14:27:15.874035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.615639Z","title":null,"venue":null,"work_id":"6489ca3b-a7c6-48de-b3cc-cf63121d8bc1","year":null},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:16.015561Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:955878fb473b0cf637bb82702d9e94bd46daf014812b13e0203ad50471e5711a","observation_id":"41bdf037-fc82-43e5-b1cd-8f4d9b98bd02","resolution":{"observed_at":"2026-08-07T14:27:20.618602Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.599485Z","title":"Large-scale video panoptic segmentation in the wild: A benchmark, in: Proceedings of the IEEE/CVF Conference on Computer Vision and Pat- tern Recognition, pp","venue":null,"work_id":"1a6c514c-1704-4053-92c3-33ee8f77e6ba","year":2022},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:16.115719Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:677e6007d1356270af55d0f63e4f26629a7fab23b957691ca22f1d9ad282c08a","observation_id":"4552696c-2c40-4fcf-8ca9-645ee71e25db","resolution":{"observed_at":"2026-08-07T14:27:20.603088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.591958Z","title":"Image segmentation using deep learning: A survey","venue":null,"work_id":"17c1cf90-a70d-4329-a951-28e8ea19ac15","year":2021},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:16.159160Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:8e4cc6c7721c4ab1276d7f821cad69dd4206d868501328dc1ad6996bd2e2aac0","observation_id":"d7785866-13af-4b67-a815-1f83c89251f6","resolution":{"observed_at":"2026-08-07T14:27:20.594634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.583619Z","title":"GPT-4 Technical Report","venue":null,"work_id":"2571f458-e8a4-4112-8c2c-6ea5ea6db049","year":null},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:16.209495Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:24a42ce0d1543da68e87dcec07e50b12c7cf58d4cfe96dfae7277d3b14c88933","observation_id":"e0d0e917-465d-46e7-9e8d-6def35c33a95","resolution":{"observed_at":"2026-08-07T14:27:20.586466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.575157Z","title":"GPT-4V(ision) System Card","venue":null,"work_id":"1dec2494-a4d7-4eec-a3e6-25baa6b708c8","year":null},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:16.250907Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:065bb5a9c4afd959a66507ea15e9186dbbb35d3356e2662c17f99130cc5a1e3f","observation_id":"1d4d6a45-bf66-432c-8b22-6c4f1b2ab48f","resolution":{"observed_at":"2026-08-07T14:27:20.578848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-07T14:27:16.276213Z","title":"Di- nov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:16.276213Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:a175d33cf04b0032cd6c095053f636af7f61a97cb051aabb12a630ca29abc591","observation_id":"53191d63-744b-4e11-9acd-8cc39efae377","resolution":{"observed_at":"2026-08-07T14:27:16.276213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.566011Z","title":"Flickr30k entities: Collecting region-to-phrase correspondences for richer image-to-sentence models, in: Proceedings of the IEEE international conference on computer vision, pp","venue":null,"work_id":"f924ae62-8a0f-4f1f-82e4-1b7ec610fc0a","year":2015},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:16.318324Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:a8ca6ab0f418fc05d1d1cf5e7f8b404a3c4cfc42c9101d0c5426c253ab0eef7e","observation_id":"9e9a4395-0340-4ad8-92db-1bdbc82aa975","resolution":{"observed_at":"2026-08-07T14:27:20.570111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-08-07T14:27:16.379401Z","title":"The 2017 davis challenge on video object segmenta- tion","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:16.379401Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:3bccdd3ce7be80e89610d26b29c9250081eda4c4b920c28f563df850d4c63539","observation_id":"264110e8-d488-4fd7-ba05-e7207fa041de","resolution":{"observed_at":"2026-08-07T14:27:16.379401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.557984Z","title":"Occluded video instance segmentation: A benchmark","venue":null,"work_id":"f6edc405-cee4-47ad-ad5d-497d02f916cf","year":2022},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:16.420028Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:7b586689cba0e4ee6dfa893258fb28f0ec572e80e3afdbfcd2e2f91dc4d4c5e1","observation_id":"184032c2-86a5-4be1-8391-b84572ca2e99","resolution":{"observed_at":"2026-08-07T14:27:20.560685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:16.459345Z","title":"Reasoning to attend: Try to understand how< seg> token works","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:16.459345Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:1f724b54ffdab1fcaff63890c82c4d1d19604f85276a25e28bc595d9154efaf3","observation_id":"316d3aa7-825b-4253-8944-3f4469407fdb","resolution":{"observed_at":"2026-08-07T14:27:16.459345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.549979Z","title":"Learning trans- ferable visual models from natural language supervision, in: International conference on machine learning, PMLR","venue":null,"work_id":"7e416922-6776-4057-9907-9454e30ab673","year":2021},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:16.502970Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:2071a56154de5f67de217c4d4d169604ce710984606b4b0acd4b9979d28e92ba","observation_id":"1a67f527-dab8-4bf5-bee0-62f351497b25","resolution":{"observed_at":"2026-08-07T14:27:20.552768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.541578Z","title":"Paco: Parts and attributes of common objects, in: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"dba4761f-31e5-4aa6-bac4-8a5fabe585b9","year":2023},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:16.551416Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:e43aea0100d11e0a95a706f3335ecf699b0bf2a7fb418b00cdc76bde0d168b56","observation_id":"e994d17d-0097-423f-9f4c-bbda7b8edf20","resolution":{"observed_at":"2026-08-07T14:27:20.544550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.532443Z","title":"Glamm: Pixelground- inglargemultimodalmodel, in: ProceedingsoftheIEEE/CVFConference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"227ec086-948f-4d3a-994e-5c44a971e43e","year":2024},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:16.605622Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:73356033eefe614eb0f8990941e88fe465364ad796829eef2c8a60c085bb3d97","observation_id":"f5f67165-0da6-4ff5-9b25-611289af9cd7","resolution":{"observed_at":"2026-08-07T14:27:20.536167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T14:27:16.663543Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:16.663543Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:021cfda0450c04674f99dd7f343d84019b9d38c5ebb315426088502eb9a389cb","observation_id":"d5e00767-6e8e-4f2e-bc96-94c6afd01c47","resolution":{"observed_at":"2026-08-07T14:27:16.663543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-07T14:27:16.717849Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:16.717849Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:ad0c07408eb15d8ff0c3bf681a6a0fb605b6aeb6c56b88c88542029c9b1a3f3b","observation_id":"13e78c09-8f72-4f36-a0a7-99b403efb154","resolution":{"observed_at":"2026-08-07T14:27:16.717849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.524015Z","title":"Pixellm: Pixel reasoning with large multimodal model, in: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"42770e6d-fd70-40cf-b8b7-3d5c0b1c69b7","year":2024},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:16.755628Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:28b91849008a871d3cec8ccffb5bdfbde26d5b26fa27b02c3169368dceb0162c","observation_id":"018d04b0-a9d8-4d8e-9aa5-5213379dccff","resolution":{"observed_at":"2026-08-07T14:27:20.527449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02156","last_updated":"2019-03-29T23:48:52Z","snapshot_observed_at":"2026-08-04T05:57:07.163978Z","submitted_at":"2018-09-06T18:25:18Z","title":"Object Hallucination in Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02156","snapshot_observed_at":"2026-08-07T14:27:16.801705Z","title":"Objecthallucinationinimagecaptioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:16.801705Z"},"links":{"cited_paper":"/paper/1809.02156","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:8ede7901da228724dfdc8f8ec2ab097a4c77f4536f971322f00a2c1db431e96c","observation_id":"b7865683-1aa7-4cf3-8385-19d6aa57d54a","resolution":{"observed_at":"2026-08-07T14:27:16.801705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.515609Z","title":null,"venue":null,"work_id":"a36af994-b8c1-408e-9496-e586689eebe4","year":2020},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:16.840520Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:2cc05bfee0256ddc24df7deb1afa4935a0eeca7895270dd23cd925f0a5a9d9b3","observation_id":"f488d60a-fcf2-408d-908e-3ea4f8cb5ed5","resolution":{"observed_at":"2026-08-07T14:27:20.518963Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03798","last_updated":"2025-05-01T22:17:41Z","snapshot_observed_at":"2026-08-07T15:57:14.091786Z","submitted_at":"2025-05-01T22:17:41Z","title":"Position: Foundation Models Need Digital Twin Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03798","snapshot_observed_at":"2026-08-07T14:27:16.888010Z","title":"Posi- tion: Foundation models need digital twin representations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:16.888010Z"},"links":{"cited_paper":"/paper/2505.03798","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:6e0058c02ef161ee586eb7a88de8cf3f9af1553abb981a6f44d161fb28970fe8","observation_id":"8f6a796f-b9c3-43eb-afa1-2f3b46f58aae","resolution":{"observed_at":"2026-08-07T14:27:16.888010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.506990Z","title":null,"venue":null,"work_id":"9b7918b8-c486-4a33-9204-8d647c3b6173","year":2025},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:16.937489Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:9a6572455a94e94f7c4ec7f3509e33f2dc5ac03805effe4fe9b5a84cb3aec78c","observation_id":"6154626e-f598-42ac-b4cf-248e91f05f2b","resolution":{"observed_at":"2026-08-07T14:27:20.510072Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11838","last_updated":"2025-05-17T04:58:09Z","snapshot_observed_at":"2026-08-07T15:44:24.475961Z","submitted_at":"2025-05-17T04:58:09Z","title":"RVTBench: A Benchmark for Visual Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11838","snapshot_observed_at":"2026-08-07T14:27:16.976460Z","title":"Rvtbench: A benchmark for visual reasoning tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:16.976460Z"},"links":{"cited_paper":"/paper/2505.11838","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:4a35505fd8d192dad06cc4cc6e25d778bb94acb72893bb56197ddb2bcdf0c1b3","observation_id":"ab7aff1f-a7d5-44b9-82d4-6c5c1e4bc53a","resolution":{"observed_at":"2026-08-07T14:27:16.976460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21054","last_updated":"2025-03-26T23:59:32Z","snapshot_observed_at":"2026-08-07T16:34:11.037601Z","submitted_at":"2025-03-26T23:59:32Z","title":"Operating Room Workflow Analysis via Reasoning Segmentation over Digital Twins","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21054","snapshot_observed_at":"2026-08-07T14:27:17.030764Z","title":"Operating room workflow analysis via reasoning segmentation over digital twins","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:17.030764Z"},"links":{"cited_paper":"/paper/2503.21054","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:a6146f8605218924eca95d65aa941a025f113988465ffb3e924edad73ecbd7d4","observation_id":"6260a082-1e7a-49cf-8066-b91dd9288ce4","resolution":{"observed_at":"2026-08-07T14:27:17.030764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21056","last_updated":"2025-03-27T00:06:40Z","snapshot_observed_at":"2026-08-07T16:34:10.485391Z","submitted_at":"2025-03-27T00:06:40Z","title":"Online Reasoning Video Segmentation with Just-in-Time Digital Twins","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21056","snapshot_observed_at":"2026-08-07T14:27:17.086609Z","title":"Online rea- soning video segmentation with just-in-time digital twins","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:17.086609Z"},"links":{"cited_paper":"/paper/2503.21056","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:2facb32e5600253b47deea489bf63e7a315c57fa5f8213821f3b6a54174c1b53","observation_id":"92574bd9-3902-4306-b588-39bf8b41ed14","resolution":{"observed_at":"2026-08-07T14:27:17.086609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.498352Z","title":null,"venue":null,"work_id":"24751921-d7cb-42c3-893e-cbf20a3a59bd","year":2020},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:17.146232Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:c7295c3fdf372dca825efb21071ec2f5a213844fb4ee48a2baf6515601f2e3d8","observation_id":"d201cc74-11a5-4ff9-b09c-545f0a9bf9ca","resolution":{"observed_at":"2026-08-07T14:27:20.501488Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-07T14:27:17.198173Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:17.198173Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:7b2598155e96e43251c36315cb0f62d9e61ea4736a4911fd494687b6640249eb","observation_id":"e75943ca-b73f-4740-b246-86923e47b367","resolution":{"observed_at":"2026-08-07T14:27:17.198173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.490033Z","title":"Growcut: Interactive multi-label nd image segmentation by cellular automata, in: proc","venue":null,"work_id":"f23d92bd-88a1-4daa-a232-55a1a3c89e3e","year":2005},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:17.223479Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:d307400c0ed670de2292eccffdeea0174f0cf5627c2ba6990521dd98e2d2eff0","observation_id":"ed7bddb8-2d12-4292-9d58-85e2c9f5c624","resolution":{"observed_at":"2026-08-07T14:27:20.493778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.480694Z","title":"Reducing the annotation effort for video object segmentation datasets, in: Proceed- ings of the IEEE/CVF Winter Conference on Applications of Computer Vision, pp","venue":null,"work_id":"27ed6e10-cbb3-4318-897e-188729f82f51","year":2021},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:17.274833Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:09d5989100f855d01bf80697066989a039c87636ef2ad9c8786e4cd0eb48cc67","observation_id":"02c0e07d-8a62-4754-b277-3d52456ef1a1","resolution":{"observed_at":"2026-08-07T14:27:20.484452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:17.319384Z","title":"Prima: Multi-image vision-language models for reasoning segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:17.319384Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:2fe2a924af87c9d70374d19d14f849c154af9fcceafdcdd995b84bd0b582cce0","observation_id":"7b617589-b580-4d20-a999-c99295fe8c3a","resolution":{"observed_at":"2026-08-07T14:27:17.319384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.471221Z","title":"Ov-vis: Open-vocabulary video instance segmentation","venue":null,"work_id":"c90273ba-717b-46c5-bcfc-462e7c089fc5","year":null},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:17.370790Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:ec36967ce4b4cef1209928376cc1ca2aff745e98e49eb61b8aa44ab44597a469","observation_id":"a5194841-dd28-44a5-bad6-18c571d4eda9","resolution":{"observed_at":"2026-08-07T14:27:20.475048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.462577Z","title":"Towards open-vocabulary video instance segmentation, in: proceedings of the IEEE/CVF international conference on computer vision, pp","venue":null,"work_id":"7090215b-20e0-4751-ab0f-c540f9650681","year":2023},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:17.422485Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:1a84f4805b88bd06e9ce4c252d93c2d841e29ea82c1f18844fee78b9469c6249","observation_id":"4f1441ef-eeb7-4181-9c0a-80a193c00a37","resolution":{"observed_at":"2026-08-07T14:27:20.465799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.454792Z","title":"Llm-seg: Bridging image segmentation and large language model reasoning, in: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"4e3c17d8-b6d9-453d-8ed7-5a615db85681","year":2024},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:17.475549Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:2c7cfb85e7d768a06710d4a508b23c839f0b2936e94edb861596291a54c34f97","observation_id":"77313945-d7f1-4d7f-8ddb-150254cd2b55","resolution":{"observed_at":"2026-08-07T14:27:20.457907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.446698Z","title":"Unidentified video objects: A benchmark for dense, open-world segmentation, in: Proceed- ings of the IEEE/CVF international conference on computer vision, pp","venue":null,"work_id":"84535baf-57ad-481b-8956-66110f00c327","year":2021},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:17.515490Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:3943744c2b9f6f360109602eb2e8a8581e8c5865b75f4de607b3736b65575a60","observation_id":"135e0f7e-ac33-4b4b-822b-7803a27d02ac","resolution":{"observed_at":"2026-08-07T14:27:20.450167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18923","last_updated":"2024-10-31T19:44:05Z","snapshot_observed_at":"2026-08-07T00:25:33.233087Z","submitted_at":"2024-10-24T17:11:52Z","title":"SegLLM: Multi-round Reasoning Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18923","snapshot_observed_at":"2026-08-07T14:27:17.599286Z","title":"Segllm: Multi-roundreasoningsegmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:17.599286Z"},"links":{"cited_paper":"/paper/2410.18923","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:7e484d8d0f2bfbdd419207a9c14275a8beabd1973285c19714444eb299792ee1","observation_id":"69049e09-7e92-4305-a151-604abd22817f","resolution":{"observed_at":"2026-08-07T14:27:17.599286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08506","last_updated":"2024-04-12T14:40:45Z","snapshot_observed_at":"2026-08-02T23:06:41.458983Z","submitted_at":"2024-04-12T14:40:45Z","title":"LaSagnA: Language-based Segmentation Assistant for Complex Queries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08506","snapshot_observed_at":"2026-08-07T14:27:17.662473Z","title":"Lasagna: Language-based segmentation assistant for complex queries","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:17.662473Z"},"links":{"cited_paper":"/paper/2404.08506","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:86abd58a421baef3b82d4360aaeec0e1e34e2271fe82c8613540008acf61d8de","observation_id":"c58eabf6-7f01-4e6e-92c4-d9cbc0d0ad04","resolution":{"observed_at":"2026-08-07T14:27:17.662473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14006","last_updated":"2024-12-18T16:20:40Z","snapshot_observed_at":"2026-07-06T20:09:24.415233Z","submitted_at":"2024-12-18T16:20:40Z","title":"InstructSeg: Unifying Instructed Visual Segmentation with Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14006","snapshot_observed_at":"2026-08-07T14:27:17.717014Z","title":"Instructseg: Unifying instructed visual segmentation with multi-modal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:17.717014Z"},"links":{"cited_paper":"/paper/2412.14006","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:b88b05295ca2179aa46ba9b9256da2e3cae78bedf750398d0904840b614b1c0d","observation_id":"84d1e245-ea60-4124-8039-1caec776250d","resolution":{"observed_at":"2026-08-07T14:27:17.717014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:17.757478Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:17.757478Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:253a0a2c51880337050db529935ab199a2c6a9783aba4c63e21280c4b59084c1","observation_id":"87f917ea-32ca-4d10-a3e9-72157c73ce39","resolution":{"observed_at":"2026-08-07T14:27:17.757478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.434103Z","title":"Ov- parts: Towards open-vocabulary part segmentation","venue":null,"work_id":"321d8ff1-e7d8-4fe9-9fe5-6ae5ad81436e","year":null},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:17.799215Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:bb929a04295713e135e1239af6eae6e4d000105f830f988a77ea15b36482239b","observation_id":"f4eeaab8-288b-41c1-a4a6-1bde2a30ff2b","resolution":{"observed_at":"2026-08-07T14:27:20.437125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.425812Z","title":"Phrasecut: Language- based image segmentation in the wild, in: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"d2b96a4b-b931-45f1-823e-a54065970a06","year":2020},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:17.895761Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:05ad0382ab5589711c91e4c05e6682a8dec76a31a9e6431d445c3e32bdc307d4","observation_id":"d94a26f9-d9b2-495b-a66b-3aec75517bdd","resolution":{"observed_at":"2026-08-07T14:27:20.428859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.416509Z","title":"See say and segment: Teaching lmms to overcome false premises, in: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"dfbe2a94-866c-4bf9-ac02-30b40ac69f9b","year":2024},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:18.002307Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:08de1b30b36b274e092758f184474b51a10a7a38dd83bb85ed0f900838378693","observation_id":"482a4945-58ae-4189-81d3-31cdb93c7b47","resolution":{"observed_at":"2026-08-07T14:27:20.420604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.407468Z","title":"Gsva: Generalized segmentation via multimodal large language models, in: Pro- ceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"2242a5c7-53ef-444b-ba4a-0b446bed131d","year":2024},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:18.077397Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:5f4e30de4050c02a122868ab505a01fc8369241456ca947b277d018a4ab05e82","observation_id":"1682cf05-b69a-4cd6-a225-5c8f435a83c4","resolution":{"observed_at":"2026-08-07T14:27:20.411628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.399683Z","title":"Youtube-vos: Sequence-to-sequence video object segmentation, in: Proceedings of the European conference on computer vision (ECCV), pp","venue":null,"work_id":"62c7377d-273c-4760-bb28-be86efc111be","year":2018},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:18.152778Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:26e7cbdfe6a8a410b11d63ddd793e6d9499e1de9724efd09cd738d28a7a99f55","observation_id":"2aeeff76-74e6-4d7e-a14a-eace992817c2","resolution":{"observed_at":"2026-08-07T14:27:20.402971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.392096Z","title":"Visa: Reasoning video object segmentation via large language models, in: European Conference on Computer Vision, Springer","venue":null,"work_id":"4205fcdd-fd79-413d-988c-b1bd71b2f675","year":2024},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:18.244911Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:e92691fb570b31dc7072b48fb02f34c36452710f46029b3efd6c99d05daa495e","observation_id":"a8374649-c868-43fb-a8d0-65a273149fd8","resolution":{"observed_at":"2026-08-07T14:27:20.395243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.383875Z","title":"Panop- tic scene graph generation, in: European Conference on Computer Vision, Springer","venue":null,"work_id":"e639f564-84bb-4e77-aa4c-7d7e3faffb2f","year":null},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:18.337726Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:1d16fd5b8d0f848fd638ad76c11e08d5eb92761c745d0445ea2c71df54e49dd7","observation_id":"a40796a9-b8ff-4ef7-8d6d-11208ac46186","resolution":{"observed_at":"2026-08-07T14:27:20.386965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.375277Z","title":"Video instance segmentation, in: Pro- ceedings of the IEEE/CVF international conference on computer vision, pp","venue":null,"work_id":"f20976e7-eed1-4128-a31b-44563dc85c0c","year":2019},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:18.419486Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:27e7ab34d4ef064839d39a8f8ab6d00a1ebc2a517c457c524740efbc53c700b2","observation_id":"0f8c2825-a571-46e7-ab1b-7d7dde838826","resolution":{"observed_at":"2026-08-07T14:27:20.379641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09414","snapshot_observed_at":"2026-08-07T14:27:18.497202Z","title":"Depth anything v2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:18.497202Z"},"links":{"cited_paper":"/paper/2406.09414","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:6ca01693f2ceede9a85071d4f5f564e9f9fe3acf4f082635741aa9da80abf97e","observation_id":"5eadc24a-072c-40ed-a1b0-bfaa947003b7","resolution":{"observed_at":"2026-08-07T14:27:18.497202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.366039Z","title":"An improved baseline for reasoning segmentation with large language model","venue":null,"work_id":"b1e674e0-4882-48e0-8dcf-b70cd8e515b4","year":2023},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:18.567677Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:5447cbf2252e77ef651dd6a6683c106cca6406ce78b8677b82c4ea36986e04a5","observation_id":"2d846f45-b74d-4917-bef0-fe69edc5c59d","resolution":{"observed_at":"2026-08-07T14:27:20.369615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14141","last_updated":"2024-03-21T05:36:25Z","snapshot_observed_at":"2026-08-08T08:23:34.513852Z","submitted_at":"2024-03-21T05:36:25Z","title":"Empowering Segmentation Ability to Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14141","snapshot_observed_at":"2026-08-07T14:27:18.655378Z","title":"Empowering segmentation ability to multi-modal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:18.655378Z"},"links":{"cited_paper":"/paper/2403.14141","citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:66c317cd38ce51c8487e4391a14afaca297c8ef4ec26c0e2448442681461c516","observation_id":"61a7ef6b-27f3-4b50-8a02-cc88f72dbcf5","resolution":{"observed_at":"2026-08-07T14:27:18.655378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.356490Z","title":"Follow the rules: reasoning for video anomaly detection with large language models, in: European Conference on Computer Vision, Springer","venue":null,"work_id":"0de3b0bc-4b6f-446b-ba90-e8663ee2d75f","year":null},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:18.716411Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:a30ab4fbb3cc3639063ed670d4eb76232c31b7813977d371946c335ad08c5d52","observation_id":"add5e5f7-086d-41d7-be11-5af856289345","resolution":{"observed_at":"2026-08-07T14:27:20.360394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:27:20.347231Z","title":"Lavt: Language-aware vision transformer for referring image segmenta- tion, in: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"f1e4b7e3-9ea6-4a77-90ef-ef77edf4c37c","year":null},"citing_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:18.789405Z"},"links":{"citing_paper":"/paper/2505.18816"},"observation_digest":"sha256:de6f2349a9f57932e2ea2915bb2463a65b224b9e265cccbcecb798c70b1a1702","observation_id":"a8ad9b85-c90d-4b59-b68f-c088e2d7806d","resolution":{"observed_at":"2026-08-07T14:27:20.350859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T21:26:48.765722Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":66,"verified_exact":2,"verified_fuzzy":32},"total_outbound_references":114},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 114 outbound references and 5 inbound Pith citation observations for arXiv:2505.18816."}