{"as_of":"2026-08-09T15:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:98afa3abed9fd2dffc2fb509284e4c278a9d1f687d7f4ffa37104516dde9bab4","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:55:00.551518Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.16974/citation-record","integrity":"/paper/2505.16974/integrity","json":"/paper/2505.16974/citation-record.json","paper":"/paper/2505.16974"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T14:54:55.240935Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:55.240935Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:057d43eb3bf75cf072239f3fcf27d7f9140fdef31d7c8d054247f0e1bda285ee","observation_id":"df149757-9719-42f6-bd58-513ab091fd15","resolution":{"observed_at":"2026-08-07T14:54:55.240935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:06.984124Z","title":"Graph of thoughts: Solving elaborate problems with large language models","venue":null,"work_id":"d442647b-8d2e-4504-b703-49dfa952c0be","year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:55.363794Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:599378e4aeae046b91c1e8322643b9978bc23be2d319baf5a3b642ee11ac4f4f","observation_id":"4578038d-0ddb-43cf-9d97-397ef8b17960","resolution":{"observed_at":"2026-08-07T14:55:07.079856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:06.820105Z","title":"Zero-shot semantic segmentation","venue":null,"work_id":"e6710209-fb1e-49be-a4e9-92ce33b60cfb","year":2019},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:55.471678Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:5a4e5ff3f657133f65f122a334facc82860e0a16e7e544dd2adf9808c6f968fc","observation_id":"c2019963-a214-4127-b28d-8ac89486bb4b","resolution":{"observed_at":"2026-08-07T14:55:06.889923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:06.626333Z","title":"Universeg: Universal medical image segmentation","venue":null,"work_id":"85272797-4762-4148-b3ce-35717f66dc34","year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:55.632824Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:69688c19b58d9782db85b473cfe4e175f66503b09e812d7e9a172de19c57bb3c","observation_id":"40020426-045a-4894-9068-7e192cc80a6b","resolution":{"observed_at":"2026-08-07T14:55:06.752714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:06.480013Z","title":"Coco-stuff: Thing and stuff classes in context","venue":null,"work_id":"f8cf83ff-21e6-44eb-8233-20918b31eb13","year":2018},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:55.725912Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:827609a916940b26ecd76ae92750aba6ef3e1f05391e4dfe6073a8a55280a3c0","observation_id":"49588e13-dea1-4ec5-ad0d-8333c24c4045","resolution":{"observed_at":"2026-08-07T14:55:06.536458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11324","last_updated":"2023-07-15T11:04:26Z","snapshot_observed_at":"2026-08-09T03:41:13.121428Z","submitted_at":"2023-03-20T17:58:48Z","title":"Open-vocabulary Panoptic Segmentation with Embedding Modulation","version":2},"cited_work":{"arxiv_id":"2303.11324","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.11324","snapshot_observed_at":"2026-08-07T14:55:00.828696Z","title":"Open-vocabulary Panoptic Segmentation with Embedding Modulation","venue":"cs.CV","work_id":"66f5ecee-16b5-4fe7-999e-12cc3cc1ecb1","year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:55.892210Z"},"links":{"cited_paper":"/paper/2303.11324","citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:303102de14e6379f40f89c357ff910c3996edae4daf2e80a1118099f665d59b2","observation_id":"c43c090b-7aa8-44f6-92ac-1a41cc932c59","resolution":{"observed_at":"2026-08-07T14:55:00.904928Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:06.297915Z","title":"Cat-seg: Cost aggregation for open-vocabulary semantic segmentation","venue":null,"work_id":"5cb9a2f0-5fca-47a8-a76f-3d340b76a8e5","year":2024},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:56.030234Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:ec17c8bfc5b6070b214c7feda72b78dc8c3c44c93a10fe2560f0762e55412027","observation_id":"b198457e-bddd-4661-9983-dad10af30503","resolution":{"observed_at":"2026-08-07T14:55:06.385908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:56.160013Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:56.160013Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:44dda2072dcb94c1023edce2f92353767c31408ecb81ff32cc57721dc8c578dc","observation_id":"0777d304-fb0f-4b12-97de-423a7a0ee9e0","resolution":{"observed_at":"2026-08-07T14:54:56.160013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-07T14:54:56.327756Z","title":"Bert: Pre-training of deep bidirec- tional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:56.327756Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:e9b25b9870768fdf9de59354cd431a038bd31186f8a57a486446fce08104146b","observation_id":"9cc0c596-ff2e-4e0c-995a-acd6b46f4722","resolution":{"observed_at":"2026-08-07T14:54:56.327756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:06.031265Z","title":"Decoupling zero-shot semantic segmentation","venue":null,"work_id":"39576bbf-693f-43e8-83b4-663ee116375b","year":2022},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:56.447706Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:0c4da0dd97d6d90f00ad3a5e5f16b50af040266071d937452737719df9926800","observation_id":"aacaaa08-2934-415c-b5d3-e424452e28a6","resolution":{"observed_at":"2026-08-07T14:55:06.166465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08984","last_updated":"2023-06-08T06:35:33Z","snapshot_observed_at":"2026-07-06T13:43:13.386359Z","submitted_at":"2022-08-18T17:55:37Z","title":"Open-Vocabulary Universal Image Segmentation with MaskCLIP","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.08984","snapshot_observed_at":"2026-08-07T14:54:56.581313Z","title":"Open-vocabulary panoptic segmentation with maskclip","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:56.581313Z"},"links":{"cited_paper":"/paper/2208.08984","citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:56493a5d96889d29473b9c401fa17089d925ca4dd3ba1512355d51510fcc6f2a","observation_id":"83d48697-11f7-4868-a57c-3cf4d82be658","resolution":{"observed_at":"2026-08-07T14:54:56.581313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:05.796655Z","title":"The pascal visual object classes (voc) challenge","venue":null,"work_id":"f76be5b3-44be-48fc-8e3f-97e81783f811","year":2010},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:56.708615Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:fcaac00382f1c20043674728926d51d38331da3a4f214df148fe6a27040fe986","observation_id":"9cc51b88-a13b-40c0-a803-a88b04d905cb","resolution":{"observed_at":"2026-08-07T14:55:05.917178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:05.643106Z","title":"Scaling open-vocabulary image segmentation with image-level labels","venue":null,"work_id":"84e83383-0ee1-40f7-9786-1ef2a157e62a","year":2022},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:56.830080Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:91841ce2dc4da091ade730bdb45806d5c5855475ed6956301e2527c80c525786","observation_id":"5bd78bbe-6f87-441c-aa74-09563c718b7e","resolution":{"observed_at":"2026-08-07T14:55:05.707881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:05.402704Z","title":"Zero-shot semantic segmentation with decoupled one-pass network","venue":null,"work_id":"68cd0a3c-deef-4850-9602-394e88714b01","year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:56.932257Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:2f5496620c22214e396fe3a344325956e5dcf58ed907fddc055241e3be9d5bd6","observation_id":"164f693e-1b65-4fc7-b736-8e0dadaeb057","resolution":{"observed_at":"2026-08-07T14:55:05.548234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:05.123687Z","title":"Global knowledge calibration for fast open-vocabulary segmentation","venue":null,"work_id":"7c2ee154-df85-48ef-a417-3addffffb610","year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:57.039423Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:17223472a522f48245e714e34651af0e679063eb25b76c9292a68038b2421cfc","observation_id":"d139baad-6cbd-4e96-87c4-e70358865c18","resolution":{"observed_at":"2026-08-07T14:55:05.221150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:04.870189Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"ea9ad3a2-c89d-4726-94b5-5d7e98955270","year":2021},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:57.163043Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:f08c07a2b544c9829730e10977ed8475e865dc193356e71ca2f47a5f0faf96b0","observation_id":"7e81d9c2-8bca-4c7f-84d3-e4114901a61a","resolution":{"observed_at":"2026-08-07T14:55:04.972743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:04.674808Z","title":"Learning mask-aware clip representations for zero-shot segmentation","venue":null,"work_id":"f42aab2e-db28-4d53-937b-3f1d4bd14090","year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:57.307185Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:e1f3365398d9f607b8440968608866a2da88b731d10251b965595d0350df642c","observation_id":"f5f74da9-0825-4969-988a-a1e57ad87eed","resolution":{"observed_at":"2026-08-07T14:55:04.750944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:04.548776Z","title":"Collaborative vision-text representation optimizing for open-vocabulary segmentation","venue":null,"work_id":"12df4b1e-01dd-4fe0-9d60-ee0fabff7616","year":2024},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:57.419543Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:59d11e984a99a99452cd65a5f39fb15addc1119afc652c76d9e0b32584a9a61d","observation_id":"27036efb-9f51-4bc9-afa4-098bdee7fa1a","resolution":{"observed_at":"2026-08-07T14:55:04.621215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:04.425554Z","title":"Fineclip: Self-distilled region-based clip for better fine-grained understanding","venue":null,"work_id":"43b3fff5-76d5-4e79-b7a3-64f51c4e053b","year":2024},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:57.531488Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:910964bb0ce7799de778713ca69544cfe6865153333c592a0b62e36ba4b027b2","observation_id":"574db350-6d7f-4060-8ecf-1d6ff4801ad9","resolution":{"observed_at":"2026-08-07T14:55:04.482616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:04.258994Z","title":"Language-driven semantic segmentation","venue":null,"work_id":"10125177-fa5a-4f8e-b6a8-3aa9648a125c","year":2022},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:57.647856Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:5ec0a818a8daece38509d5a1d722f6d2bd6ac13b9fe4e5e3d085fa3d482f1c3d","observation_id":"8320a18e-e446-40ac-95b9-c2e7059435f7","resolution":{"observed_at":"2026-08-07T14:55:04.388296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-07T14:54:57.749830Z","title":"Visualbert: A simple and performant baseline for vision and language","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:57.749830Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:8c62395e08d1e0b914a0ffa1b15a0d695aad11400b5772bde1bcc66ce2513900","observation_id":"b4383c59-9070-4d5a-ad65-30260036bff8","resolution":{"observed_at":"2026-08-07T14:54:57.749830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:57.910363Z","title":"Open-vocabulary semantic segmentation with mask-adapted clip","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:57.910363Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:4d3b54ba5a1680363c29ee4bc5a55df0a5104cd8448d6167656eb8eb11243947","observation_id":"6dc1f31a-8330-4627-89cf-e9498b80aeee","resolution":{"observed_at":"2026-08-07T14:54:57.910363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:58.058849Z","title":"Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Dollár, and C","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:58.058849Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:630286710d488837d36959e37c5ca6c45728506b20146e3eaa750bf719b6cb96","observation_id":"6e3c758c-288f-4ebd-aff3-ecf00a8b8acf","resolution":{"observed_at":"2026-08-07T14:54:58.058849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:58.183536Z","title":"Remoteclip: A vision language foundation model for remote sensing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:58.183536Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:0e4106dadbde1670247a77fb0bbbcbb9b51c058bf03709307b75aff45123f039","observation_id":"a7ad0235-1ac3-4b39-ba25-af92070b4925","resolution":{"observed_at":"2026-08-07T14:54:58.183536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:58.265405Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:58.265405Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:326cf74187b3306e49a11323adb3e04d9efa9199b9641f95822283558b83f236","observation_id":"612b4647-fc5a-4c37-ae34-c2c78ff30e6d","resolution":{"observed_at":"2026-08-07T14:54:58.265405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:04.052253Z","title":"Open-vocabulary segmentation with semantic-assisted calibration","venue":null,"work_id":"7262cb71-d8f8-41c8-9bc6-58fdd72f0736","year":2024},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:58.325734Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:9239dcbf1fd41b3c707201a2fbd800500682bd93dc940f652d5ab568509b5d3e","observation_id":"3e3b7e24-d71e-4fa2-9d5c-c84289256291","resolution":{"observed_at":"2026-08-07T14:55:04.111055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:58.395860Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:58.395860Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:4d33b4208434cdf06c2764ca4d5fc0d5ff2a4e8c0f4730de52b2859643b6e5d7","observation_id":"828f60e5-2be0-455d-b510-ef587b841767","resolution":{"observed_at":"2026-08-07T14:54:58.395860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:03.926911Z","title":"The role of context for object detection and semantic segmentation in the wild","venue":null,"work_id":"2fc563f9-6c6b-4a70-bfea-100f2466b38b","year":2014},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:58.464432Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:8c9f031efe763c230afd722871371f88c8e46e196295d86db007b98af6547daa","observation_id":"49bfb041-e989-46cd-9089-36ccbf3c9196","resolution":{"observed_at":"2026-08-07T14:55:04.002636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:03.780192Z","title":"Open vocabulary semantic segmentation with patch aligned contrastive learning","venue":null,"work_id":"93a1bd66-31ec-44f8-8600-efc71c16eb87","year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:58.528576Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:066c40525a4349abc4f9001601e34dce2cea7f5586819a87c6704f4b20aa9429","observation_id":"0fd97115-b573-4bf3-b7eb-eb594cca3a09","resolution":{"observed_at":"2026-08-07T14:55:03.819317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:03.520542Z","title":"Multi-modal fusion transformer for end-to-end autonomous driving","venue":null,"work_id":"f6d1cd82-a0b5-412b-a288-1f2e7425a277","year":2021},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:58.607678Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:ea8db4c52c4fd45a19417b450ca54718f7325a78794234e0f6b16d433ae0dbad","observation_id":"07b727f7-4407-4391-87fe-a8bfe5b40612","resolution":{"observed_at":"2026-08-07T14:55:03.640330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17225","last_updated":"2023-03-30T08:42:49Z","snapshot_observed_at":"2026-07-06T15:10:01.106455Z","submitted_at":"2023-03-30T08:42:49Z","title":"FreeSeg: Unified, Universal and Open-Vocabulary Image Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17225","snapshot_observed_at":"2026-08-07T14:54:58.663806Z","title":"Freeseg: Unified, universal and open-vocabulary image segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:58.663806Z"},"links":{"cited_paper":"/paper/2303.17225","citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:4362f056c1050ff03a2c177ac95a125e4732292ed41b3f5ef16c34814e619517","observation_id":"65821ae5-7d69-417f-b360-c715d3232fee","resolution":{"observed_at":"2026-08-07T14:54:58.663806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:03.342611Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"cc2ad7fb-8a90-4770-9526-9a81f79edc34","year":2021},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:58.739918Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:1a213a453a571f54835b897fd7cf5933cc5113c6e88aab48896f88078c3f112b","observation_id":"40fd47e4-5ccb-4d95-8057-d06f4e269c23","resolution":{"observed_at":"2026-08-07T14:55:03.433810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:03.191576Z","title":"Making monolingual sentence embeddings multilingual using knowledge distillation","venue":null,"work_id":"ea46b1eb-905e-4afa-b94b-b846073a2de7","year":2020},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:58.824637Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:957f936dc3e0df714d55220c363a1ba79037568f4fd3e24c2bd1026b32eadd42","observation_id":"58b812b2-610e-4deb-9b50-9716536baee4","resolution":{"observed_at":"2026-08-07T14:55:03.276249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T14:54:58.916036Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:58.916036Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:dc45c28729f5a73899c28d099849907e448e11255c9e07363b2856cd46cf3076","observation_id":"980ea46c-73a8-4e5a-8a0a-02ee1dcdcd9d","resolution":{"observed_at":"2026-08-07T14:54:58.916036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.00764","last_updated":"2023-12-21T18:28:31Z","snapshot_observed_at":"2026-08-06T08:50:46.025992Z","submitted_at":"2023-07-03T06:02:15Z","title":"Hierarchical Open-vocabulary Universal Image Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.00764","snapshot_observed_at":"2026-08-07T14:54:59.006598Z","title":"Hierarchical open-vocabulary universal image segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:59.006598Z"},"links":{"cited_paper":"/paper/2307.00764","citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:4a3e6dab9540e41fe7e91fe0855646afe5b3389192d7526783f8939960dfd58d","observation_id":"88db6878-8b79-429d-91bb-cd8e387a1eed","resolution":{"observed_at":"2026-08-07T14:54:59.006598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:02.999412Z","title":"Skyscript: A large and semantically diverse vision-language dataset for remote sensing","venue":null,"work_id":"03043109-6068-41c6-a7d3-4b3a15310f21","year":2024},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:59.128753Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:f1706bf07c09be884e8fcbb0c93f9aa574b3223369efbc823e5e91e5d17dcdd9","observation_id":"d0328e41-79fb-439d-bfa9-29ee22989ef7","resolution":{"observed_at":"2026-08-07T14:55:03.090513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:02.833616Z","title":null,"venue":null,"work_id":"8b7edefa-e56b-4af2-8b40-660c51adef5d","year":2022},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:59.217814Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:cdb7831228613c84a964f34f2eac9587ca042bba8b552f938423bbd28ef0dab6","observation_id":"d05a8e1a-f177-4d60-9cec-c94438c6bcee","resolution":{"observed_at":"2026-08-07T14:55:02.915036Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:59.291116Z","title":"Towards open vocabulary learning: A survey.IEEE Transactions on Pattern Analysis and Machine Intelligence, 46(7):5092–5113, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:59.291116Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:c72b351185a71e1613792d9e6f34e6fa29c4dcde62c6bc841750975195de374e","observation_id":"724773e4-fce9-46a7-ad91-2321f1791518","resolution":{"observed_at":"2026-08-07T14:54:59.291116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:02.631519Z","title":"Semantic projection network for zero-and few-label semantic segmentation","venue":null,"work_id":"4af998c1-581d-4a89-8320-1f67bb458ac6","year":2019},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:59.370838Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:dc740932b7935bb09d19cfb84b32e736ac1c8a735131d9af1cc6696b17196285","observation_id":"aaa4a721-8054-4507-a337-1d5eaba0f8da","resolution":{"observed_at":"2026-08-07T14:55:02.723235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:02.386824Z","title":"Sed: A simple encoder-decoder for open-vocabulary semantic segmentation","venue":null,"work_id":"3fa45c7d-7c5b-4836-a715-671ea3f98003","year":2024},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:59.427761Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:bf0af4d69285821d92b98dece6acf3c42d16cb379937128875b01773a9c11e1f","observation_id":"5c91a28c-d88e-495f-b5df-05e93952e17b","resolution":{"observed_at":"2026-08-07T14:55:02.473823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05071","last_updated":"2025-05-21T06:18:41Z","snapshot_observed_at":"2026-08-09T03:39:57.040395Z","submitted_at":"2025-05-08T09:06:53Z","title":"FG-CLIP: Fine-Grained Visual and Textual Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05071","snapshot_observed_at":"2026-08-07T14:54:59.478902Z","title":"Fg-clip: Fine-grained visual and textual alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:59.478902Z"},"links":{"cited_paper":"/paper/2505.05071","citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:d5b98b6db5a8e340a06742adf5756cbbfb4d60676b13f306799a043ad3aa76c9","observation_id":"aa57dabe-d4a1-4abf-9dbc-0aa92135ffcd","resolution":{"observed_at":"2026-08-07T14:54:59.478902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:02.202322Z","title":"Groupvit: Semantic segmentation emerges from text supervision","venue":null,"work_id":"ac03335d-b337-4733-9a50-339bd119e356","year":2022},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:59.483387Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:a8ad0393b7c0737e19d1511e6956acc37181d3e55c8b880045556f74c2e39b3f","observation_id":"c3f26acd-faf6-4078-bc6c-5d03ddd068f7","resolution":{"observed_at":"2026-08-07T14:55:02.312747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:02.015522Z","title":"Open- vocabulary panoptic segmentation with text-to-image diffusion models","venue":null,"work_id":"f9e1f953-5ebe-4781-89a6-a7cef56f65ad","year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:59.487505Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:744865233d366ac6ee249643d3a6e9c2aacc6940ad6fcd797b48555c8a02f180","observation_id":"3bb9c853-c64c-4a00-8b97-13231b6c07a4","resolution":{"observed_at":"2026-08-07T14:55:02.077359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:01.812016Z","title":"Side adapter network for open- vocabulary semantic segmentation","venue":null,"work_id":"74ab0aaf-2ceb-45fb-a1bb-0d35297b1f27","year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:59.513964Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:427d62367218e42c4e0bfc00cc216b185ab8d68e49488bee6247d71ebc182b2f","observation_id":"2f433679-d701-49d4-a2de-51dfafef1f24","resolution":{"observed_at":"2026-08-07T14:55:01.904214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:01.646857Z","title":"A simple baseline for open-vocabulary semantic segmentation with pre-trained vision-language model","venue":null,"work_id":"8784ab53-847d-4b4d-a969-014e55f60193","year":2022},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:59.662103Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:6c8543730a4a74ba9f92b5ce9c4b2b475e643d1dc2472c5dfcd85b1e1efd673a","observation_id":"7b46e5e6-873c-453c-ba2c-2b4741ec673e","resolution":{"observed_at":"2026-08-07T14:55:01.697431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T14:54:59.779546Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:59.779546Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:c6a8fc5392ef73f71c4b71a9d879832ebc94f8de006b252eeb36fe0b1c3c7810","observation_id":"4ff54c76-ce13-40da-86d2-51777c03cf60","resolution":{"observed_at":"2026-08-07T14:54:59.779546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:54:59.859535Z","title":"Griffiths, Yuan Cao, and Karthik Narasimhan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:59.859535Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:4223fe4c402ad2207f1fc28adc35d59e330918a8502c03232bcdc22a44eef2d3","observation_id":"ebb9b491-ccbe-4ff3-853c-9da6848c6fd7","resolution":{"observed_at":"2026-08-07T14:54:59.859535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02487","last_updated":"2023-11-14T19:10:49Z","snapshot_observed_at":"2026-08-04T01:52:38.789872Z","submitted_at":"2023-08-04T17:59:01Z","title":"Convolutions Die Hard: Open-Vocabulary Segmentation with Single Frozen Convolutional CLIP","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02487","snapshot_observed_at":"2026-08-07T14:54:59.953787Z","title":"Convolutions die hard: Open- vocabulary segmentation with single frozen convolutional clip","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:59.953787Z"},"links":{"cited_paper":"/paper/2308.02487","citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:c4829641211e233da7ffe167859bf92207f41c5819d39550ca1755e909574641","observation_id":"b30d5edf-523b-4beb-99bc-3da5699f1760","resolution":{"observed_at":"2026-08-07T14:54:59.953787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:01.490562Z","title":null,"venue":null,"work_id":"e9def4a3-b822-4a13-8b3d-47cec7164136","year":2023},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:00.053025Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:a33dfd002ac643f59b62c6e13d38977b4cf19f8f39901fe3526124be5497e70b","observation_id":"953fa962-b130-421d-9353-a104c2b3654a","resolution":{"observed_at":"2026-08-07T14:55:01.547819Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:01.331159Z","title":"Open vocabulary scene parsing","venue":null,"work_id":"5baa35ac-0196-4443-a7c4-7c55e9613c23","year":2002},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:00.211996Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:5a47216f35387be16a582d5a0459fe0c4e27c189b7cb46538c2eb38a68d3c598","observation_id":"56f356e3-2342-4a39-b49e-c1289f74e590","resolution":{"observed_at":"2026-08-07T14:55:01.417148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:01.163858Z","title":"A foundation model for joint segmentation, detection and recognition of biomedical objects across nine modalities","venue":null,"work_id":"a9cf00c2-2fdd-4171-ac42-310668549f61","year":2025},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:00.310535Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:62a26ca28eee778dd187c23a98a68c69e8b74e7f67f885a16414261b504d5df5","observation_id":"77bd9a7c-9559-4bf6-bba7-f28c2265ac16","resolution":{"observed_at":"2026-08-07T14:55:01.236717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:00.412108Z","title":"Semantic understanding of scenes through the ade20k dataset","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:00.412108Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:cea43988f39d4eb5a4d2348e6bbac0eb5b210e35a84b0ff8aa955c6fc3ded23b","observation_id":"815b547b-6a51-4578-85c1-b63601e02c2c","resolution":{"observed_at":"2026-08-07T14:55:00.412108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:55:00.991433Z","title":"Extract free dense labels from clip","venue":null,"work_id":"29f4df1e-74b4-42de-bb41-4c0c8061c015","year":2022},"citing_paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:55:00.551518Z"},"links":{"citing_paper":"/paper/2505.16974"},"observation_digest":"sha256:f9c99d19e23424c1ac576e89bb6a9f3ab4d3b5619c8e9d38653c7e2a8e6f0d78","observation_id":"c2b565aa-38f2-4291-94d4-e5c6c474e51e","resolution":{"observed_at":"2026-08-07T14:55:01.051537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.16974","last_updated":"2025-08-01T08:53:45Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T08:08:02.350903Z","submitted_at":"2025-05-22T17:51:48Z","title":"OpenSeg-R: Improving Open-Vocabulary Segmentation via Step-by-Step Visual Reasoning"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":1,"verified_fuzzy":31},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2505.16974."}