{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:6AT4TEORUHSJKE464D2JEFCKKX","short_pith_number":"pith:6AT4TEOR","schema_version":"1.0","canonical_sha256":"f027c991d1a1e495139ee0f492144a55e568d8d5f724e828a13915f51b42171d","source":{"kind":"arxiv","id":"2502.09447","version":1},"attestation_state":"computed","paper":{"title":"Pixel-Level Reasoning Segmentation via Multi-turn Conversations","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CV","authors_text":"Daling Wang, Dexian Cai, Shi Feng, Soujanya Poria, Xiaocui Yang, Yifei Zhang, Yongkang Liu","submitted_at":"2025-02-13T16:16:54Z","abstract_excerpt":"Existing visual perception systems focus on region-level segmentation in single-turn dialogues, relying on complex and explicit query instructions. Such systems cannot reason at the pixel level and comprehend dynamic user intent that changes over interaction. Our work tackles this issue by introducing a novel task, Pixel-level Reasoning Segmentation (Pixel-level RS) based on multi-turn conversations, tracking evolving user intent via multi-turn interactions for fine-grained segmentation. To establish a benchmark for this novel task, we build a Pixel-level ReasonIng Segmentation Dataset Based o"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.09447","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-02-13T16:16:54Z","cross_cats_sorted":["cs.CL"],"title_canon_sha256":"018130ee720ffe6bbc5db9cd92ee96c2e010566d2b03ae964cfa1c8d9b826f0d","abstract_canon_sha256":"a08122856802a401dbba328e40ef373dcb096d968b0287f9c9728264fb026154"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:13:57.859869Z","signature_b64":"6pBVoZ6CX79eRPkdCu9eRtO97c4tykqcErpeI37lF0ko2cv9yYHWJEehw7uGNBCBxygN9RxtL+xdpeupqlqHCA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"f027c991d1a1e495139ee0f492144a55e568d8d5f724e828a13915f51b42171d","last_reissued_at":"2026-07-05T10:13:57.859371Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:13:57.859371Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Pixel-Level Reasoning Segmentation via Multi-turn Conversations","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CV","authors_text":"Daling Wang, Dexian Cai, Shi Feng, Soujanya Poria, Xiaocui Yang, Yifei Zhang, Yongkang Liu","submitted_at":"2025-02-13T16:16:54Z","abstract_excerpt":"Existing visual perception systems focus on region-level segmentation in single-turn dialogues, relying on complex and explicit query instructions. Such systems cannot reason at the pixel level and comprehend dynamic user intent that changes over interaction. Our work tackles this issue by introducing a novel task, Pixel-level Reasoning Segmentation (Pixel-level RS) based on multi-turn conversations, tracking evolving user intent via multi-turn interactions for fine-grained segmentation. To establish a benchmark for this novel task, we build a Pixel-level ReasonIng Segmentation Dataset Based o"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.09447","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.09447/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.09447","created_at":"2026-07-05T10:13:57.859428+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.09447v1","created_at":"2026-07-05T10:13:57.859428+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.09447","created_at":"2026-07-05T10:13:57.859428+00:00"},{"alias_kind":"pith_short_12","alias_value":"6AT4TEORUHSJ","created_at":"2026-07-05T10:13:57.859428+00:00"},{"alias_kind":"pith_short_16","alias_value":"6AT4TEORUHSJKE46","created_at":"2026-07-05T10:13:57.859428+00:00"},{"alias_kind":"pith_short_8","alias_value":"6AT4TEOR","created_at":"2026-07-05T10:13:57.859428+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.26196","citing_title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","ref_index":74,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/6AT4TEORUHSJKE464D2JEFCKKX","json":"https://pith.science/pith/6AT4TEORUHSJKE464D2JEFCKKX.json","graph_json":"https://pith.science/api/pith-number/6AT4TEORUHSJKE464D2JEFCKKX/graph.json","events_json":"https://pith.science/api/pith-number/6AT4TEORUHSJKE464D2JEFCKKX/events.json","paper":"https://pith.science/paper/6AT4TEOR"},"agent_actions":{"view_html":"https://pith.science/pith/6AT4TEORUHSJKE464D2JEFCKKX","download_json":"https://pith.science/pith/6AT4TEORUHSJKE464D2JEFCKKX.json","view_paper":"https://pith.science/paper/6AT4TEOR","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.09447&json=true","fetch_graph":"https://pith.science/api/pith-number/6AT4TEORUHSJKE464D2JEFCKKX/graph.json","fetch_events":"https://pith.science/api/pith-number/6AT4TEORUHSJKE464D2JEFCKKX/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/6AT4TEORUHSJKE464D2JEFCKKX/action/timestamp_anchor","attest_storage":"https://pith.science/pith/6AT4TEORUHSJKE464D2JEFCKKX/action/storage_attestation","attest_author":"https://pith.science/pith/6AT4TEORUHSJKE464D2JEFCKKX/action/author_attestation","sign_citation":"https://pith.science/pith/6AT4TEORUHSJKE464D2JEFCKKX/action/citation_signature","submit_replication":"https://pith.science/pith/6AT4TEORUHSJKE464D2JEFCKKX/action/replication_record"}},"created_at":"2026-07-05T10:13:57.859428+00:00","updated_at":"2026-07-05T10:13:57.859428+00:00"}