{"as_of":"2026-08-13T00:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0740a8a674f5ce4488d1c577962df0a15c7e582742bfafdf4de2296fe5054431","coverage":[{"denominator":94,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":94,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T10:10:41.196244Z","state":"measured"},{"denominator":96,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":96,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T07:43:32.954256Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:54.913171Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00153","snapshot_observed_at":"2026-08-04T07:43:32.954256Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24857","last_updated":"2026-07-14T15:19:12Z","snapshot_observed_at":"2026-08-04T07:43:27.393282Z","submitted_at":"2025-10-28T18:04:09Z","title":"Bias from small-scale leakage in Pulsar Timing Array maps","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:32.954256Z"},"links":{"cited_paper":"/paper/2412.00153","citing_paper":"/paper/2510.24857"},"observation_digest":"sha256:baa079a442a375992f8e547ea8b4526bb29615219dc7eb479d6f366f5c0be17b","observation_id":"5a541e7d-6bdb-4f7b-8188-4377cd6f44ad","resolution":{"observed_at":"2026-08-04T07:43:32.954256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"cited_work":{"arxiv_id":"2412.00153","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.00153","snapshot_observed_at":"2026-07-04T15:09:54.913171Z","title":null,"venue":null,"work_id":"f8238cd2-f4a2-465c-9717-b7a29c7d4494","year":2024},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2412.00153","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:382fe7fdaa8f4433e229da1fe4d497b9414ed26431291e831b0b50e41311ebe7","observation_id":"115d2920-c1bf-478d-af38-9de4301a7d7e","resolution":{"observed_at":"2026-07-04T15:09:54.914750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.00153/citation-record","integrity":"/paper/2412.00153/integrity","json":"/paper/2412.00153/citation-record.json","paper":"/paper/2412.00153"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1803.08375","last_updated":"2026-04-14T12:21:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-22T14:30:17Z","title":"Deep Learning using Rectified Linear Units (ReLU)","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.08375","snapshot_observed_at":"2026-08-12T10:10:40.602727Z","title":"Deep learning using rectified linear units (relu)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.602727Z"},"links":{"cited_paper":"/paper/1803.08375","citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:ffd933370c270a75a1a3beec4c9c7ff5b9d417b19bd594c03c79adf783e8079d","observation_id":"cc9054c9-867b-423a-b426-2fa2669f5baf","resolution":{"observed_at":"2026-08-12T10:10:40.602727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:40.608496Z","title":"Barron, Fer- ran Marques, and Jitendra Malik","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.608496Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:0d897bcf313cb15dc116559f2f39a4ac0086b7cc9b950ce5f4cdd7097801a374","observation_id":"33724053-7262-4073-b3cf-99c545c9044c","resolution":{"observed_at":"2026-08-12T10:10:40.608496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-12T10:10:40.614159Z","title":"Qwen tech- nical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.614159Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:92cf82308aebaf3eb2863f5169e6bac9c43097ef38db3070664f8e872879bde2","observation_id":"406c57ea-401b-4377-82dd-566577064de0","resolution":{"observed_at":"2026-08-12T10:10:40.614159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05673","last_updated":"2024-07-11T03:25:06Z","snapshot_observed_at":"2026-08-13T00:34:48.552057Z","submitted_at":"2024-04-08T16:55:39Z","title":"CoReS: Orchestrating the Dance of Reasoning and Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05673","snapshot_observed_at":"2026-08-12T10:10:40.619538Z","title":"Cores: Orchestrating the dance of reasoning and seg- mentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.619538Z"},"links":{"cited_paper":"/paper/2404.05673","citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:be0ffb85071c9f63e89ac089ec341e372ec10067af59b4d177c0425d87c62d36","observation_id":"8e606117-7d9f-443f-bb03-db732569e074","resolution":{"observed_at":"2026-08-12T10:10:40.619538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-12T10:10:40.625056Z","title":"PaliGemma: A versatile 3B VLM for transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.625056Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:9a5f1ab164be3d4f481b46021a0a25aa9b2084b5154d6ceeaa18f9504877195e","observation_id":"8670c5ab-c675-4e1c-a7c2-8de69265d678","resolution":{"observed_at":"2026-08-12T10:10:40.625056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:40.630566Z","title":"Coco- stuff: Thing and stuff classes in context","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.630566Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:d33ac10e182c8574e1aafe44b09aa09a7c587e2b5e6df3614d20bf8b25081eaf","observation_id":"baea3694-043d-48ac-8e92-fe3d7526c3b3","resolution":{"observed_at":"2026-08-12T10:10:40.630566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:40.636951Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.636951Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:40cb80dba8bc714814853d01582c6867aee5f3a65c02075e6e8f0aa7f1559e42","observation_id":"a4dae4b5-f4a4-496e-acb3-bec70a780927","resolution":{"observed_at":"2026-08-12T10:10:40.636951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-12T10:10:40.646884Z","title":"Shikra: Unleashing multi- modal llm’s referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.646884Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:6d34d6c8114ec2d968b307519fb663c4c59416df1a52326af9ec29daa2acb963","observation_id":"01ddf6a1-4087-4e6b-96da-84fe45560491","resolution":{"observed_at":"2026-08-12T10:10:40.646884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:40.655072Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.655072Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:ab44fdb08c47c35ff3237b357dee11409bb711cd951c2ed65d2532d35db076a4","observation_id":"ee8b1da5-7b65-49ca-b49a-e87c59f6ab99","resolution":{"observed_at":"2026-08-12T10:10:40.655072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05587","last_updated":"2017-12-05T18:06:21Z","snapshot_observed_at":"2026-08-07T13:44:53.690521Z","submitted_at":"2017-06-17T22:48:57Z","title":"Rethinking Atrous Convolution for Semantic Image Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05587","snapshot_observed_at":"2026-08-12T10:10:40.663763Z","title":"Rethinking atrous convolution for semantic image segmentation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.663763Z"},"links":{"cited_paper":"/paper/1706.05587","citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:7ca0f434072af913c732271ccd35bb9007b3c6d4f29c79f696d7c21d5f597111","observation_id":"7c3a0701-eb07-4aa1-a8e6-ac61d243cd8a","resolution":{"observed_at":"2026-08-12T10:10:40.663763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07669","last_updated":"2022-10-16T02:41:15Z","snapshot_observed_at":"2026-07-06T13:21:17.244944Z","submitted_at":"2022-06-15T17:08:53Z","title":"A Unified Sequence Interface for Vision Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07669","snapshot_observed_at":"2026-08-12T10:10:40.671530Z","title":"Fleet, and Geoffrey Hinton","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.671530Z"},"links":{"cited_paper":"/paper/2206.07669","citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:988dcb437ef57bc4ccb0375e67d8abdd49d09835d4da1eae3ff3641a503c90b0","observation_id":"63341173-fefd-42f3-bdce-6bfaa1798857","resolution":{"observed_at":"2026-08-12T10:10:40.671530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:40.678258Z","title":"Schwing, and Alexander Kir- illov","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.678258Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:db18903c6a26070e7245135fb03bbacefd5d3a260dfb561edd5541c9a2b48510","observation_id":"b7eb7c55-f6dd-4d02-bb83-2848e14e3f8e","resolution":{"observed_at":"2026-08-12T10:10:40.678258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:40.684396Z","title":"Schwing, Alexan- der Kirillov, and Rohit Girdhar","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.684396Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:f1eb6e7e663505825b70368924be4e4c79945adee0f9928c4118bcffc74d1e7a","observation_id":"a79df8a7-3099-4d6b-b159-806618062944","resolution":{"observed_at":"2026-08-12T10:10:40.684396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:40.690426Z","title":"CascadePSP: Toward class-agnostic and very high- resolution segmentation via global and local refinement","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.690426Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:39fed60650ee5307928bab387765219875a4b9a7c047c5080c2501e33fbfb3b2","observation_id":"f8a1f219-05f4-46f2-8f6b-6705ee8b53ce","resolution":{"observed_at":"2026-08-12T10:10:40.690426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:40.694974Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.694974Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:c622eec699774e4eb7566985b52747a49d30a3670671b478be3a4e9c9b5335bb","observation_id":"472714cf-0a71-48e2-ad16-e20305fe19bd","resolution":{"observed_at":"2026-08-12T10:10:40.694974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:40.700692Z","title":"Instance-aware se- mantic segmentation via multi-task network cascades","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.700692Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:4f6177f57d563c422cfa51077f126407c5b35826031d9e5b5118daad02f9845a","observation_id":"0cf0912c-d82e-4403-96eb-81220347d1e6","resolution":{"observed_at":"2026-08-12T10:10:40.700692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-12T10:10:40.708748Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.708748Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:9aa096826fb3f9a403e12cd2cbe2cc2a16cfbecf3a2ee7526b6b7243c3982926","observation_id":"f9fde1d8-d406-4036-b6e1-d06598d11d26","resolution":{"observed_at":"2026-08-12T10:10:40.708748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:40.720146Z","title":"Vision-language transformer and query generation for refer- ring segmentation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.720146Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:742ade1e361d7680ffa171ff35bd3779368a03df7ebcc02ba51555280e1b720b","observation_id":"9b38e67c-72ca-45f5-9857-f083d57431a7","resolution":{"observed_at":"2026-08-12T10:10:40.720146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:40.725466Z","title":"De- coupling zero-shot semantic segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.725466Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:fac98ff1681810d1474f6cd08daae22730b9a363274cd9e6093cf2f3729acc5e","observation_id":"86d48a15-4367-4cad-b139-7a0fd8be5078","resolution":{"observed_at":"2026-08-12T10:10:40.725466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:40.732244Z","title":"A discriminatively trained, multiscale, deformable part model","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.732244Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:700b01c4dae99d360c9c15f3870b048024bceb846cbafd156a6835ebfdbc0f78","observation_id":"ce5e425e-f964-4565-afbd-cfd6c5d71098","resolution":{"observed_at":"2026-08-12T10:10:40.732244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:40.738344Z","title":"Dual attention network for scene segmentation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.738344Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:c765721e80165e0ebf4dbfa45596f644c3a9a49edebbf3476dfce0ce717a3387","observation_id":"712ad1f6-051a-4afe-b9ae-0cf631fd18fa","resolution":{"observed_at":"2026-08-12T10:10:40.738344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:40.744388Z","title":"Scal- ing open-vocabulary image segmentation with image-level labels","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.744388Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:d84a77acc79ab33a5faa3706c3338067822a54e3699c9b9be6a894d57b591c82","observation_id":"468bd23d-d2f5-4d5f-a882-d82b4d1655ea","resolution":{"observed_at":"2026-08-12T10:10:40.744388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.824923Z","title":"Fast r-cnn","venue":null,"work_id":"8e60c1d4-e99a-43e5-b615-bd953a504dcd","year":2015},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.750583Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:ee25551a947302908cebe81c1e07e7c18ffda474e2be5acadc3622426fd6694a","observation_id":"c3f0ae87-5a05-4d50-a933-63407e84642a","resolution":{"observed_at":"2026-08-12T10:10:42.829966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.806819Z","title":"Efficient hierarchical graph-based video segmentation","venue":null,"work_id":"660884aa-dc38-4e7b-95ed-cd750c0bf3d5","year":2010},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.757926Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:ac5eceee21f8d305a64e308eac2f7ddecbe8267ed4c2a13e1e8959990668ff61","observation_id":"4e1b00fc-59f0-437c-8b0b-7adb9f285eb7","resolution":{"observed_at":"2026-08-12T10:10:42.813092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.08575","last_updated":"2022-09-18T14:33:49Z","snapshot_observed_at":"2026-08-09T05:44:03.390421Z","submitted_at":"2022-09-18T14:33:49Z","title":"SegNeXt: Rethinking Convolutional Attention Design for Semantic Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.08575","snapshot_observed_at":"2026-08-12T10:10:40.764202Z","title":"Segnext: Rethinking convolutional attention design for semantic segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.764202Z"},"links":{"cited_paper":"/paper/2209.08575","citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:dbdff0358fb63dc356c7c53e68180d9877f4a87ed1833ce795d30dc6f4b1b077","observation_id":"feadfcc1-fa40-435e-9f00-49e411c620cf","resolution":{"observed_at":"2026-08-12T10:10:40.764202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.787658Z","title":"Global knowledge calibration for fast open-vocabulary segmentation","venue":null,"work_id":"f279cd6a-2498-49b7-a392-d6619f5bdc1c","year":2023},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.770557Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:de9ffe0a1a5596460dec766e9267f929ea970d8c7e48577769541837b730d9e8","observation_id":"3d406e68-77a8-4547-8ecd-a6be74544aa0","resolution":{"observed_at":"2026-08-12T10:10:42.794206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.765250Z","title":"Multi-modal instruction tuned llms with fine-grained visual perception","venue":null,"work_id":"fbaba442-0790-42b8-ba1d-edbb4d84e4af","year":2024},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.779725Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:fe034d54b4fa597e40a12158862459b6707100494f4b27180087135058d877e7","observation_id":"695588bf-8ac2-4c5f-b90a-4ce4999a5c09","resolution":{"observed_at":"2026-08-12T10:10:42.772644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T10:10:40.787127Z","title":"Lora: Low-rank adaptation of large language mod- els","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.787127Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:8d10cb8dbf460de77904cf1cc3c59b9418232d40bdfd396513c8d6f52eebad7b","observation_id":"8328d994-4c35-4f3c-855e-87f1083541ca","resolution":{"observed_at":"2026-08-12T10:10:40.787127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.740532Z","title":"Bi-directional relationship inferring network for referring image segmentation","venue":null,"work_id":"2995cdd1-04f7-4f5f-9894-9e5cc460b925","year":2020},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.794615Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:cc51b2cf6dd001f8b10ce1e3cba728878ff25e5c46c3f8e940f4ea151c7483a4","observation_id":"667a8c61-474c-4eb2-bdc1-a78bf072d809","resolution":{"observed_at":"2026-08-12T10:10:42.751208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.717413Z","title":"Referring im- age segmentation via cross-modal progressive comprehen- sion","venue":null,"work_id":"69032fb5-00d1-453a-9a73-d9645711f2d8","year":2020},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.801817Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:476ff61c7f3e27db6ae03cc986a9b0a90ca5a51a7257968ca68ad0e5307c41d0","observation_id":"f72b2860-a780-43f2-94a4-44a5abbbbb04","resolution":{"observed_at":"2026-08-12T10:10:42.727435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.693822Z","title":"CCNet: Criss-cross attention for semantic segmentation","venue":null,"work_id":"63ea7a12-be57-41ed-9612-a6da5d8251b1","year":2019},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.807249Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:a3d6750021fe0b7cf8fea619a18fddd1a9245d9dc853e86e161606cd682b0774","observation_id":"8592435d-0e8b-42ed-a9fc-ac42b5963117","resolution":{"observed_at":"2026-08-12T10:10:42.699887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:40.817090Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.817090Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:086bfbcf5052b9ccf10c38e7e116b52c4fee93ca8ce6bce6e5b62cea5a01e218","observation_id":"9b3796b3-aed2-4e82-aa22-ac393def43ef","resolution":{"observed_at":"2026-08-12T10:10:40.817090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.647753Z","title":"Collaborative vision-text rep- resentation optimizing for open-vocabulary segmentation","venue":null,"work_id":"f07a2e1a-fbd6-42f6-96e9-8ed76fdf7fad","year":2024},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.825753Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:7d396e6b2eedc0634ff9ae18149beac69035a57e4de34194ebcd6643af7f5d5c","observation_id":"f72a46c9-8ce4-4987-be4d-80882b00fa95","resolution":{"observed_at":"2026-08-12T10:10:42.655968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.628745Z","title":"Locate then segment: A strong pipeline for referring image segmentation","venue":null,"work_id":"5379758a-2c89-4d72-b683-2b0190600b64","year":2021},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.830882Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:ff95168cd868c7eb1287bc086017bba381e5daeb93d4b1327f2e398415277128","observation_id":"7fdc2374-2927-4d20-89ef-ce062cd36847","resolution":{"observed_at":"2026-08-12T10:10:42.634113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.608064Z","title":"Referitgame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":"ba7b9e95-757f-4b08-8f6e-710d19b9a517","year":2014},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.837314Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:dfa3aa75ac92d1a52746c98c3c137d4ee5f1b1991bf9ad7e80fcd3c11ee33d96","observation_id":"06feee68-e2b9-4bf9-a4f7-05bc6e827007","resolution":{"observed_at":"2026-08-12T10:10:42.613695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.587763Z","title":"Segment any- thing","venue":null,"work_id":"7e1466b7-4a9c-4ece-89bc-acf8353771e8","year":2023},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.845266Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:ea08469fc14634ff8adac42102401cb874bf4ec45e7de99a50b2ef67831c51f2","observation_id":"6433f450-c112-4599-a060-8f5da956b3be","resolution":{"observed_at":"2026-08-12T10:10:42.593290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.562879Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":"98075eba-1651-4b15-86c3-60e0956f4340","year":2022},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.852552Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:1fb64ef8bce1a545a9d790b3587492553360c1d6facf9091e47f20ec31d8191c","observation_id":"b2c2b052-bab4-4579-a33b-62edd58b93a9","resolution":{"observed_at":"2026-08-12T10:10:42.569494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:40.859899Z","title":"Lisa: Reasoning segmenta- tion via large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.859899Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:6e171d5bf34c055b7277c7936a83dfd9b7a8ca73f378f11d1f0a7b4bbabd939e","observation_id":"83edde41-c518-440b-80c9-ed98b8846423","resolution":{"observed_at":"2026-08-12T10:10:40.859899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-12T10:10:40.867634Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.867634Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:e386e0fe635320a6077e9603d02a2949d58ecaf973fb6ae3703641608d98b7eb","observation_id":"c36fba00-d6af-4aeb-86a7-9886842fa00a","resolution":{"observed_at":"2026-08-12T10:10:40.867634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.523497Z","title":"BLIP-2: bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"0b6e611f-f4a9-4501-b7e9-1228d50afe13","year":2023},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.873795Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:b61e85add4725bb75cd68beb12fdb214e15aa086e1c08b91a212ab00d371eec2","observation_id":"877046cf-543e-44f7-9091-4932d560821a","resolution":{"observed_at":"2026-08-12T10:10:42.529184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.503395Z","title":"Referring transformer: A one- step approach to multi-task visual grounding","venue":null,"work_id":"1ba765d5-dc70-4281-b609-d053f87cfd37","year":null},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.879409Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:c700d5d7d214efa125e8d7b11ae9e0bc611d62ff1257f47f81cc882512a6d8a8","observation_id":"690077fb-17d7-47a2-b76e-8a6bd67a5223","resolution":{"observed_at":"2026-08-12T10:10:42.509319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.475726Z","title":"Textbooks are all you need ii: phi-1.5 technical report, 2023","venue":null,"work_id":"b388cae9-569f-45d1-9ac5-52e4941ffb06","year":2023},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.885283Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:93d1b4dad68f201004b0046142d90962a87556a1e954e0d09063ab6792b92d38","observation_id":"72a2b959-46dd-4dea-a489-e37fced6d16b","resolution":{"observed_at":"2026-08-12T10:10:42.486608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.445124Z","title":"Open-vocabulary semantic segmentation with mask-adapted clip","venue":null,"work_id":"c4b27059-7af6-406c-86d8-f36085ab7d32","year":2023},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.892528Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:08a47499bea0580fdcc526449947a7276adce22500d92e60f0433a5a3de2f5f7","observation_id":"dec07de0-38ab-4eaa-ac37-913a67839e81","resolution":{"observed_at":"2026-08-12T10:10:42.452323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1405.0312","last_updated":"2015-02-21T01:48:49Z","snapshot_observed_at":"2026-07-06T03:42:37.507458Z","submitted_at":"2014-05-01T21:43:32Z","title":"Microsoft COCO: Common Objects in Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1405.0312","snapshot_observed_at":"2026-08-12T10:10:40.897561Z","title":"Belongie, Lubomir D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.897561Z"},"links":{"cited_paper":"/paper/1405.0312","citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:db73ff220449d1139b86ac1334446cd97a268a11dde6a2b16a3f4a9aae9d90e8","observation_id":"07ea0b25-15aa-4478-8a64-45321df358fc","resolution":{"observed_at":"2026-08-12T10:10:40.897561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:40.903182Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.903182Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:cc608685558fa736cbf86d251c56fb48ce9b10bf0f01628005f9044d5719f47a","observation_id":"32b269f7-7bff-4b8b-9bff-f80d8a639b46","resolution":{"observed_at":"2026-08-12T10:10:40.903182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.402503Z","title":"Fully convolutional networks for semantic segmentation","venue":null,"work_id":"7595f41c-7732-461b-973c-2f3a162f0962","year":2015},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.908369Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:52e461a61e6cae74d785f99521488230fb8159555317e21152961329d168673a","observation_id":"12d2280a-d8f1-466d-9559-30e2cbbcb6aa","resolution":{"observed_at":"2026-08-12T10:10:42.410159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-12T10:10:40.913998Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.913998Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:f507125a6b0eda89a8d7dba23a9741d1b2ceb195a35d9abf197d926b8ff4c5fd","observation_id":"6e189871-22a0-43f1-b894-35761da8fbf6","resolution":{"observed_at":"2026-08-12T10:10:40.913998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.381761Z","title":"Cascade grouped attention network for referring expression segmentation","venue":null,"work_id":"8de80438-40eb-4cb1-94c3-3c29b236fafa","year":2020},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.919613Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:9a80342f2fa3a89686ee1415d4042dcf356407114cb56ffef05565df41aae3f9","observation_id":"c2ab0f93-7bd6-42cc-91df-66e21610c6b1","resolution":{"observed_at":"2026-08-12T10:10:42.388448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.359894Z","title":"Generation and comprehension of unambiguous object descriptions","venue":null,"work_id":"25101701-9da2-4ffa-a17e-217790b9f150","year":2016},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.924413Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:0e36ad92d9f15502aac3d8b94597a3d694c9b571f8a182bc79f9a1e8d2e2f0d9","observation_id":"104f859b-3744-4b76-8055-2c3b3d9115d3","resolution":{"observed_at":"2026-08-12T10:10:42.366413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:40.930956Z","title":"The mapillary vistas dataset for semantic understanding of street scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.930956Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:9304a084414137f33bf1396ab82a01ca98ccc9bf57c6869db78d5b59e18e30f7","observation_id":"872b78b8-0097-48b5-9244-de8b596374c7","resolution":{"observed_at":"2026-08-12T10:10:40.930956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.311683Z","title":"Chatgpt: A language model for conversational ai","venue":null,"work_id":"fdcbe22e-6a34-4208-bb1e-977075ccdd30","year":2023},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.935743Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:57103afdb349c445b835a8039a7bdebf1a848ecfbe313bae32eb9960c5e5a673","observation_id":"019f3a6a-ded3-4691-9e91-19bfd3467ebf","resolution":{"observed_at":"2026-08-12T10:10:42.319108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:40.944616Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.944616Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:35f52825627e452797644173335c4188627b8b2d4bd388cf47f433fc10d1eba5","observation_id":"dac3c2a1-6ded-4d4f-8369-3e8dc3e16b12","resolution":{"observed_at":"2026-08-12T10:10:40.944616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.269926Z","title":"Kosmos-2: Ground- ing multimodal large language models to the world","venue":null,"work_id":"a19d1fab-0452-4542-a7b2-0b4f0f6c59dd","year":2023},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.951145Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:35dc401869e69493000ae744fb0447525917083592727c609be6a881b9112a7a","observation_id":"34c97eb1-eb05-4fbc-b68e-a2a15804a35b","resolution":{"observed_at":"2026-08-12T10:10:42.278398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-12T10:10:40.957551Z","title":"Kosmos-2: Grounding multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.957551Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:a995df4114cdc6ed948426187126a4b3da41c91872f2bb1d52a4ca412368a67d","observation_id":"39d0a7dd-ec4e-4fa7-82c8-81ee1552a315","resolution":{"observed_at":"2026-08-12T10:10:40.957551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.249823Z","title":null,"venue":null,"work_id":"b462401b-e2c9-45d7-8f3c-e23e6408b6b3","year":2015},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.963755Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:aec1021199c40ca0d33fa147e4515b5406b06cb178c38eb9dfcd60624ae5f88a","observation_id":"4484be1f-82de-4194-8d0e-62c05722f88a","resolution":{"observed_at":"2026-08-12T10:10:42.255454Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.230015Z","title":"Pinheiro, Tsung-Yi Lin, Ronan Collobert, and Piotr Doll´ar","venue":null,"work_id":"10315c41-d885-49d8-b729-ba5a08b4ce3f","year":2016},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.968878Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:dd9647bd468ea799f8cedbe8b61d476a611e6370a0cdd7281ea310356aea709a","observation_id":"770cf0eb-9593-48f3-9639-6196fc696c0a","resolution":{"observed_at":"2026-08-12T10:10:42.235786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.210653Z","title":"Multiscale combinatorial grouping for image segmentation and object proposal gener- ation","venue":null,"work_id":"6b35c04a-8d29-4913-acb9-34aa061e6422","year":2016},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.974233Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:2a65efb4ddf67ff82c4858827f73406f03998dc1b174b19c19b7363b8b97fb9b","observation_id":"c36e3f83-f330-46be-a92a-f67190285945","resolution":{"observed_at":"2026-08-12T10:10:42.217544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.190157Z","title":"Learning to segment every referring object point by point","venue":null,"work_id":"66a461c2-f1d6-4f31-a84d-76d05f5f0fcd","year":2023},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.980144Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:b8e868cb11197ce2a7923da1054191e3903a6b88447c50867faf33708ab83633","observation_id":"57339680-1a03-4d27-85a4-2380a7780b00","resolution":{"observed_at":"2026-08-12T10:10:42.197893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:40.986159Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.986159Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:b5ff92d6da6c31708530535e2df4886790d63c1bb838a95d1fe76e443e76e0f2","observation_id":"59a4f07e-f360-429a-b3d5-51a7e8aa0aeb","resolution":{"observed_at":"2026-08-12T10:10:40.986159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:40.993676Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:40.993676Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:6d6c69cc8626a84f429cb838ad730e51726b700fbc0c434da1be3ffa419e43df","observation_id":"d5f58f64-088c-4ebc-88cd-82efb08cd80c","resolution":{"observed_at":"2026-08-12T10:10:40.993676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.123182Z","title":"Anwer, Eric Xing, Ming-Hsuan Yang, and Fahad S","venue":null,"work_id":"2c42fe7c-27ce-48bb-a7bc-438463ba0429","year":null},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.001120Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:92d822274b689a8444b68261ad28ff06aa590f4eb26b5f7e2a7010550c9b50bc","observation_id":"95f21376-6334-48a6-8ff1-4d766b914a40","resolution":{"observed_at":"2026-08-12T10:10:42.129623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.097557Z","title":"Deepspeed: System optimizations enable train- ing deep learning models with over 100 billion parameters","venue":null,"work_id":"2ecba17f-b375-459b-8d0f-0868b8b81f73","year":2020},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.006137Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:b8cfea882c87698fd89d71cb6fc5c187a9eec6c5cfc105bed9fe42c11f9979be","observation_id":"3e3e2a8f-2770-47de-9ed6-c23a7c8d921d","resolution":{"observed_at":"2026-08-12T10:10:42.104654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.071578Z","title":"Pixellm: Pixel reasoning with large multimodal model","venue":null,"work_id":"cb0dcf67-7aa9-457d-a5e6-f598d9ee17c6","year":2024},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.011579Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:c2df9216b29f15e1fe5dbba087ee587585f8bb49920ad59a7769410c27e4dde0","observation_id":"6084e481-980e-45df-863d-ead855e42446","resolution":{"observed_at":"2026-08-12T10:10:42.078881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.042735Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":"a424cf31-7da9-4dab-afac-791b9a479584","year":2015},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.017480Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:c5e3b7915c51a5b1441e5f07b3b4a2b3166fe60a9c0859da345337aa2e1922a0","observation_id":"091d006e-4246-4292-9933-ae0e13200fe1","resolution":{"observed_at":"2026-08-12T10:10:42.050276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T10:10:41.022299Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.022299Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:a652af7992d6f7796e0c5539366cd38fc68d7e5e7d08eebf42f3aef8718b761d","observation_id":"b01dd00a-2855-4aad-ac96-e22bd1db2263","resolution":{"observed_at":"2026-08-12T10:10:41.022299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:42.015755Z","title":"Selective search for object recognition","venue":null,"work_id":"75112e13-319d-424e-a51a-8e88d9d56b1c","year":2013},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.027703Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:d09054f4d07856bd2a21c1e574891296046e74643cf13de421251e37abd7f5e2","observation_id":"efaf51df-9525-4fd6-ae6d-369540f4f34d","resolution":{"observed_at":"2026-08-12T10:10:42.024766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:41.996594Z","title":"Llm-seg: Bridging image segmen- tation and large language model reasoning","venue":null,"work_id":"c9d0afa5-ac7c-4cc9-b1e5-81de47b8b2da","year":2024},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.034013Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:74f6dde79b4ae4aeda1cecfaaa27204df5e806cf89d627a2725b33739daf7b54","observation_id":"4c2effc2-46d7-4be0-96d6-1d5b96e2e933","resolution":{"observed_at":"2026-08-12T10:10:42.002608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:41.978793Z","title":"SegRefiner: Towards model- agnostic segmentation refinement with discrete diffusion process","venue":null,"work_id":"d17d5dab-9b02-4764-b7b3-6f4059c651e6","year":2023},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.040649Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:2056acdfcfa4f401d22ec5bcabd2e17d9f34f2ec4b0606de0226debfcec396d1","observation_id":"2a539345-3b75-4d8e-b1c7-e22198fa5d20","resolution":{"observed_at":"2026-08-12T10:10:41.985143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11175","last_updated":"2023-05-25T15:02:07Z","snapshot_observed_at":"2026-07-06T15:29:20.405296Z","submitted_at":"2023-05-18T17:59:42Z","title":"VisionLLM: Large Language Model is also an Open-Ended Decoder for Vision-Centric Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11175","snapshot_observed_at":"2026-08-12T10:10:41.049912Z","title":"Visionllm: Large language model is also an open-ended decoder for vision-centric tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.049912Z"},"links":{"cited_paper":"/paper/2305.11175","citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:c89592d6b53b756dd93f9d0078f58dd303956a3950416bfd821ba104de821831","observation_id":"9096e147-9792-4ea6-8cbb-84a8b06d9cec","resolution":{"observed_at":"2026-08-12T10:10:41.049912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01907","last_updated":"2023-08-03T17:59:47Z","snapshot_observed_at":"2026-07-06T16:02:15.266899Z","submitted_at":"2023-08-03T17:59:47Z","title":"The All-Seeing Project: Towards Panoptic Visual Recognition and Understanding of the Open World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01907","snapshot_observed_at":"2026-08-12T10:10:41.057624Z","title":"The all-seeing project: Towards panop- tic visual recognition and understanding of the open world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.057624Z"},"links":{"cited_paper":"/paper/2308.01907","citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:a41ee16a28315cca8f09fdf1eaecedc1dfec26aeb1375b15b6f58ae4385bf40e","observation_id":"b7b7176e-bea8-4b06-9999-8cea01f96982","resolution":{"observed_at":"2026-08-12T10:10:41.057624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:41.063230Z","title":"Non-local neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.063230Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:5690d55f5fbfa6192fe1ffb64a987adbd2f6205a47fa1284d017b1340b95b106","observation_id":"7f637c6f-b367-4b98-bea7-b68c8f2122a3","resolution":{"observed_at":"2026-08-12T10:10:41.063230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:41.951429Z","title":"SOLO: Segmenting objects by locations","venue":null,"work_id":"9588799a-5c9a-4a11-8bde-a3d3c7ff7318","year":null},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.068431Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:3882840684e5652ed24ad8222be24d5fb5dcfa5436b9418e5c2d935404fb7580","observation_id":"0374e256-6842-4722-ae9b-0d97a4800603","resolution":{"observed_at":"2026-08-12T10:10:41.956507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:41.934606Z","title":"Solov2: Dynamic and fast instance segmentation","venue":null,"work_id":"f9667a44-ab04-4f4f-a391-bca88ceb57ce","year":2020},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.073957Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:ad40f512d775f9afb4640b7630689c6686b0c52252a2d5b10f03faeafbd945a1","observation_id":"97186277-4ff4-47fe-a2ae-70c769f44316","resolution":{"observed_at":"2026-08-12T10:10:41.939830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.02499","last_updated":"2023-03-24T07:10:47Z","snapshot_observed_at":"2026-08-06T18:08:11.618043Z","submitted_at":"2022-12-05T18:59:50Z","title":"Images Speak in Images: A Generalist Painter for In-Context Visual Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.02499","snapshot_observed_at":"2026-08-12T10:10:41.080050Z","title":"Images speak in images: A general- ist painter for in-context visual learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.080050Z"},"links":{"cited_paper":"/paper/2212.02499","citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:ebfb88396cae012bfa778ac410f3d4cd5d832320d9b5679c92444ef1e24d29ca","observation_id":"df85ce4d-d2c9-4611-9ebd-2dc1a549d400","resolution":{"observed_at":"2026-08-12T10:10:41.080050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03284","last_updated":"2023-04-06T17:59:57Z","snapshot_observed_at":"2026-08-09T03:50:44.384164Z","submitted_at":"2023-04-06T17:59:57Z","title":"SegGPT: Segmenting Everything In Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03284","snapshot_observed_at":"2026-08-12T10:10:41.085777Z","title":"Seggpt: Segmenting ev- erything in context","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.085777Z"},"links":{"cited_paper":"/paper/2304.03284","citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:b031c22fa42edb1a83754a503e19f3536dea373b66678005fe670b556bb75ad0","observation_id":"125b212e-419c-4753-8ec3-e38a42756858","resolution":{"observed_at":"2026-08-12T10:10:41.085777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:41.917458Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"a5f54670-cc9c-4f75-94bb-cc6dc0b2004a","year":2022},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.091613Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:a9b8d5592b624f7e1435cf60fdb512bf6c2783133efc8b90010aa3894ef45b1e","observation_id":"59d13369-d98d-4855-b1fd-daaf17007b9c","resolution":{"observed_at":"2026-08-12T10:10:41.922973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:41.899230Z","title":"Gsva: Generalized segmentation via multimodal large language models","venue":null,"work_id":"a75193e8-37ff-40a7-a9ac-5de2f77ad036","year":2024},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.097842Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:f73fd8d50c8aebc4c899557d0b296b6d49f48211fec8b1cb3b8d45f8ee16c05f","observation_id":"9ec67287-7a75-47a5-86a9-b6c218785426","resolution":{"observed_at":"2026-08-12T10:10:41.904733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:41.104345Z","title":"Alvarez, and Ping Luo","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.104345Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:34ce0c232562532f60b82d010f6216928642f5048dad0f777c8e195f3ee43a14","observation_id":"6104d1f6-685f-4683-bf9a-d92dec4c4a89","resolution":{"observed_at":"2026-08-12T10:10:41.104345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:41.109789Z","title":"Open-vocabulary panop- tic segmentation with text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.109789Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:a74ffa372b3b58ba419794045d6bb2bfe65bd223d3020411cb18a4ecd042e6c2","observation_id":"4704578f-c2ad-4907-9140-7b5966b79f5d","resolution":{"observed_at":"2026-08-12T10:10:41.109789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:41.853879Z","title":"A simple baseline for open- vocabulary semantic segmentation with pre-trained vision- language model","venue":null,"work_id":"a9db2460-5553-4ced-bc39-d39144437a3a","year":2022},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.115102Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:1551b8dd812b8bb98b2d88f48fc7933626a0d7b30e798540dbd014860758f00f","observation_id":"d1d07908-f8ea-431a-8854-4ab39d1af1b0","resolution":{"observed_at":"2026-08-12T10:10:41.859266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:41.834314Z","title":"Fine-grained visual prompting, 2023","venue":null,"work_id":"19c00a59-1e7b-4538-aa90-4eee39897219","year":2023},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.121101Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:26295f40731f8a461be64e97414bb85ab059ca3f125dfd4e4911ba3b74ef7e60","observation_id":"730d6885-8b49-43ac-81d3-67320b97a0be","resolution":{"observed_at":"2026-08-12T10:10:41.840574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-08-12T17:07:18.793418Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-12T10:10:41.126078Z","title":"Ferret: Refer and ground anything anywhere at any granularity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.126078Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:7dc2f93c7f8b49bdab4b7921a2133070ae076630c4b8ee2612e6949b1f5a9820","observation_id":"68db3912-cd72-4051-b9a4-11fd34e18873","resolution":{"observed_at":"2026-08-12T10:10:41.126078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:41.817381Z","title":"Convolutions die hard: Open-vocabulary seg- mentation with single frozen convolutional clip","venue":null,"work_id":"d2985bb8-ce08-4c1c-b586-4af167f402f4","year":2023},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.132233Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:c2576d1e1279959aae520c550b81d77257c05c6a399e744d46d4cecad68a0344","observation_id":"0a056f1c-adde-4864-8440-8f745078ba01","resolution":{"observed_at":"2026-08-12T10:10:41.822743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:41.800243Z","title":"Osprey: Pixel un- derstanding with visual instruction tuning","venue":null,"work_id":"452389ea-bd11-4e41-aa82-e4ae61951fbd","year":2024},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.138463Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:35d2442eef7f47eacd96d5a15d71cdbda937517796ef8fc323c797c32b9be15e","observation_id":"1cc26dc8-4858-4a84-acd7-69b225e49105","resolution":{"observed_at":"2026-08-12T10:10:41.805366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:41.144523Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.144523Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:f0a3d9602ef840956ef3ceec94a4e6377f939d16d3e6d836dd533554d8bd2456","observation_id":"548302c0-d01d-4a26-9eac-6ec52d771371","resolution":{"observed_at":"2026-08-12T10:10:41.144523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03601","last_updated":"2025-06-12T00:15:18Z","snapshot_observed_at":"2026-08-07T18:00:59.339869Z","submitted_at":"2023-07-07T13:43:44Z","title":"GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03601","snapshot_observed_at":"2026-08-12T10:10:41.151302Z","title":"Gpt4roi: In- struction tuning large language model on region-of-interest","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.151302Z"},"links":{"cited_paper":"/paper/2307.03601","citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:a213dee4425aac9891eb9ef9fc7b2c80dd17eb8b87cf8b31b06472bba546f8a2","observation_id":"7556df97-c4ee-4b7d-b8ab-f513b2f3bb51","resolution":{"observed_at":"2026-08-12T10:10:41.151302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13077","last_updated":"2023-05-22T14:48:53Z","snapshot_observed_at":"2026-08-11T06:30:14.015336Z","submitted_at":"2023-05-22T14:48:53Z","title":"ControlVideo: Training-free Controllable Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13077","snapshot_observed_at":"2026-08-12T10:10:41.157888Z","title":"Controlvideo: Training-free controllable text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.157888Z"},"links":{"cited_paper":"/paper/2305.13077","citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:db99c8d773db71a7d76d91932a957799dae99c03fc0d559310f23b28264c36f7","observation_id":"5923443f-74a8-41ea-ae6e-c52518152f71","resolution":{"observed_at":"2026-08-12T10:10:41.157888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:41.768776Z","title":"Groundhog: Grounding large language models to holistic segmentation","venue":null,"work_id":"2bd1f96c-6361-444a-bc9b-6c793d2d1d7a","year":2024},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.163653Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:3725b0788d8e2379240c2579e0149b1abd3b9301c0b09b30efd2f8b1deb07f86","observation_id":"891d1b46-5fc9-4f41-a6f8-4fb9f8447cdb","resolution":{"observed_at":"2026-08-12T10:10:41.775048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:41.750076Z","title":"Psalm: Pixelwise segmentation with large multi-modal model","venue":null,"work_id":"e574069b-8274-4b81-95d5-12cac3ffef51","year":2025},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.169375Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:dcabfe60df0279640be788f742ec7bc0e6006680bc872ff502c0f8defb4c36a8","observation_id":"a43a1024-e009-476b-aede-3d65b8b1cb3a","resolution":{"observed_at":"2026-08-12T10:10:41.756026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:41.734317Z","title":"Rethinking semantic segmen- tation from a sequence-to-sequence perspective with trans- formers","venue":null,"work_id":"029a9e08-2e6d-42d4-81e5-3f6f19643cf7","year":2021},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.174302Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:45048b98d6777e0733eeffd0d731f5e858b76f0bc1c72c31ca17f2b2cd6835ca","observation_id":"46b773f9-a729-4c19-962d-315d1de1023b","resolution":{"observed_at":"2026-08-12T10:10:41.739593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:41.716230Z","title":"Scene parsing through ade20k dataset","venue":null,"work_id":"2a8f3e13-14a1-4fa3-8dc8-2e86a51b1447","year":2017},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.179846Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:8dd259ae7661609758d6fcc0854bab53276769dc15ef3e880f0b46cce483ece9","observation_id":"6e715acd-3bbc-4c16-88b8-ecfbf0d317ba","resolution":{"observed_at":"2026-08-12T10:10:41.722980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:41.698785Z","title":"Seqtr: A simple yet universal network for visual grounding","venue":null,"work_id":"7b2f866c-3d73-48b7-8b70-ac4bab21d675","year":2022},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.185531Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:00fab0decaa361ec7d884494644d226f1094feaf26fde626b30997eecba4061d","observation_id":"cf837357-61af-430d-ac08-29f3e48b1a29","resolution":{"observed_at":"2026-08-12T10:10:41.704525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-12T10:10:41.190681Z","title":"category","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.190681Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:d938a51a63366384cd1d652ab3781826049196e91c4a1325a1089feb9174f786","observation_id":"25354d67-8d8e-4442-96ce-34acb6d4f0c4","resolution":{"observed_at":"2026-08-12T10:10:41.190681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:10:41.678647Z","title":"User: <IMAGE,MASK> Please segment target region with mask and corre- sponding category","venue":null,"work_id":"cbb796ea-13cd-4447-8484-2f047e50d562","year":null},"citing_paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-12T10:10:41.196244Z"},"links":{"citing_paper":"/paper/2412.00153"},"observation_digest":"sha256:bf8a16feb57801e45ee9855ddda73dcc666c83139a64b55dd6039106aac6b81a","observation_id":"9380f26d-e32a-4e8c-b96d-46447ed59b62","resolution":{"observed_at":"2026-08-12T10:10:41.686647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.00153","last_updated":"2025-03-11T09:07:31Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T19:57:19.131122Z","submitted_at":"2024-11-29T07:00:18Z","title":"ROSE: Revolutionizing Open-Set Dense Segmentation with Patch-Wise Perceptual Large Multimodal Model"},"reference_resolution":{"displayed":94,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":0,"verified_fuzzy":45},"total_outbound_references":94},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 94 of 94 outbound references and 2 inbound Pith citation observations for arXiv:2412.00153."}