{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:QCM2QKCHHJQJDXH2EBCGCMIWEJ","short_pith_number":"pith:QCM2QKCH","schema_version":"1.0","canonical_sha256":"8099a828473a6091dcfa204461311622497e49b09f14c3a6cd0c2fd224cd4a4f","source":{"kind":"arxiv","id":"2307.00997","version":3},"attestation_state":"computed","paper":{"title":"RefSAM: Efficiently Adapting Segmenting Anything Model for Referring Video Object Segmentation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Jing Zhang, Long Lan, Xiao Teng, Xinwang Liu, Yonglin Li","submitted_at":"2023-07-03T13:21:58Z","abstract_excerpt":"The Segment Anything Model (SAM) has gained significant attention for its impressive performance in image segmentation. However, it lacks proficiency in referring video object segmentation (RVOS) due to the need for precise user-interactive prompts and a limited understanding of different modalities, such as language and vision. This paper presents the RefSAM model, which explores the potential of SAM for RVOS by incorporating multi-view information from diverse modalities and successive frames at different timestamps in an online manner. Our proposed approach adapts the original SAM model to "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2307.00997","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2023-07-03T13:21:58Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"2915b0d74d3e5e208cd39d35987880cc10d199ad4e18a6d88e9f3b31552fdadf","abstract_canon_sha256":"5a0e81f3866aeca31a7660143b0c96e8a1818f8495008c54aeb530e543ba8e36"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:02:12.133180Z","signature_b64":"LggPK/YHRcCGO6sAXc2LyDIxvO9H9QjxiWsFhcbeL8bckOx+1eIVvKf3tQyoH7KOYT5cS4RKtYH273H8XlU0DQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"8099a828473a6091dcfa204461311622497e49b09f14c3a6cd0c2fd224cd4a4f","last_reissued_at":"2026-07-05T09:02:12.132603Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:02:12.132603Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"RefSAM: Efficiently Adapting Segmenting Anything Model for Referring Video Object Segmentation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Jing Zhang, Long Lan, Xiao Teng, Xinwang Liu, Yonglin Li","submitted_at":"2023-07-03T13:21:58Z","abstract_excerpt":"The Segment Anything Model (SAM) has gained significant attention for its impressive performance in image segmentation. However, it lacks proficiency in referring video object segmentation (RVOS) due to the need for precise user-interactive prompts and a limited understanding of different modalities, such as language and vision. This paper presents the RefSAM model, which explores the potential of SAM for RVOS by incorporating multi-view information from diverse modalities and successive frames at different timestamps in an online manner. Our proposed approach adapts the original SAM model to "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2307.00997","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2307.00997/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2307.00997","created_at":"2026-07-05T09:02:12.132665+00:00"},{"alias_kind":"arxiv_version","alias_value":"2307.00997v3","created_at":"2026-07-05T09:02:12.132665+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2307.00997","created_at":"2026-07-05T09:02:12.132665+00:00"},{"alias_kind":"pith_short_12","alias_value":"QCM2QKCHHJQJ","created_at":"2026-07-05T09:02:12.132665+00:00"},{"alias_kind":"pith_short_16","alias_value":"QCM2QKCHHJQJDXH2","created_at":"2026-07-05T09:02:12.132665+00:00"},{"alias_kind":"pith_short_8","alias_value":"QCM2QKCH","created_at":"2026-07-05T09:02:12.132665+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2506.23121","citing_title":"CRISP-SAM2: SAM2 with Cross-Modal Interaction and Semantic Prompting for Multi-Organ Segmentation","ref_index":55,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/QCM2QKCHHJQJDXH2EBCGCMIWEJ","json":"https://pith.science/pith/QCM2QKCHHJQJDXH2EBCGCMIWEJ.json","graph_json":"https://pith.science/api/pith-number/QCM2QKCHHJQJDXH2EBCGCMIWEJ/graph.json","events_json":"https://pith.science/api/pith-number/QCM2QKCHHJQJDXH2EBCGCMIWEJ/events.json","paper":"https://pith.science/paper/QCM2QKCH"},"agent_actions":{"view_html":"https://pith.science/pith/QCM2QKCHHJQJDXH2EBCGCMIWEJ","download_json":"https://pith.science/pith/QCM2QKCHHJQJDXH2EBCGCMIWEJ.json","view_paper":"https://pith.science/paper/QCM2QKCH","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2307.00997&json=true","fetch_graph":"https://pith.science/api/pith-number/QCM2QKCHHJQJDXH2EBCGCMIWEJ/graph.json","fetch_events":"https://pith.science/api/pith-number/QCM2QKCHHJQJDXH2EBCGCMIWEJ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/QCM2QKCHHJQJDXH2EBCGCMIWEJ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/QCM2QKCHHJQJDXH2EBCGCMIWEJ/action/storage_attestation","attest_author":"https://pith.science/pith/QCM2QKCHHJQJDXH2EBCGCMIWEJ/action/author_attestation","sign_citation":"https://pith.science/pith/QCM2QKCHHJQJDXH2EBCGCMIWEJ/action/citation_signature","submit_replication":"https://pith.science/pith/QCM2QKCHHJQJDXH2EBCGCMIWEJ/action/replication_record"}},"created_at":"2026-07-05T09:02:12.132665+00:00","updated_at":"2026-07-05T09:02:12.132665+00:00"}