{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:4EHNOXAFN7EXKC2BTTG75735RV","short_pith_number":"pith:4EHNOXAF","schema_version":"1.0","canonical_sha256":"e10ed75c056fc9750b419ccdfeff7d8d5529549d3bf4fd7e75de7f5493673e38","source":{"kind":"arxiv","id":"2407.11325","version":1},"attestation_state":"computed","paper":{"title":"VISA: Reasoning Video Object Segmentation via Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Cilin Yan, Efstratios Gavves, Guoliang Kang, Haochen Wang, Shilin Yan, Weidi Xie, Xiaolong Jiang, Yao Hu","submitted_at":"2024-07-16T02:29:29Z","abstract_excerpt":"Existing Video Object Segmentation (VOS) relies on explicit user instructions, such as categories, masks, or short phrases, restricting their ability to perform complex video segmentation requiring reasoning with world knowledge. In this paper, we introduce a new task, Reasoning Video Object Segmentation (ReasonVOS). This task aims to generate a sequence of segmentation masks in response to implicit text queries that require complex reasoning abilities based on world knowledge and video contexts, which is crucial for structured environment understanding and object-centric interactions, pivotal"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2407.11325","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-07-16T02:29:29Z","cross_cats_sorted":[],"title_canon_sha256":"1bbc036fb990f7698911c24c298b0b1de25a0182f80205188b4168fc85fc4bf1","abstract_canon_sha256":"c59e97cdcbf63d1135837fcb16f0109f4561bcccd06a677769ce8eaf4b4a1b24"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:44:22.369512Z","signature_b64":"W3JIKPi5wKF4vR5V0q6fmoUpSm2cC4HeOrTt2hIhh+USdDQoDe6kXdq29hLI7Ym0tEzlXjP6YkIPGr/GpBu2Dw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"e10ed75c056fc9750b419ccdfeff7d8d5529549d3bf4fd7e75de7f5493673e38","last_reissued_at":"2026-07-05T08:44:22.368938Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:44:22.368938Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"VISA: Reasoning Video Object Segmentation via Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Cilin Yan, Efstratios Gavves, Guoliang Kang, Haochen Wang, Shilin Yan, Weidi Xie, Xiaolong Jiang, Yao Hu","submitted_at":"2024-07-16T02:29:29Z","abstract_excerpt":"Existing Video Object Segmentation (VOS) relies on explicit user instructions, such as categories, masks, or short phrases, restricting their ability to perform complex video segmentation requiring reasoning with world knowledge. In this paper, we introduce a new task, Reasoning Video Object Segmentation (ReasonVOS). This task aims to generate a sequence of segmentation masks in response to implicit text queries that require complex reasoning abilities based on world knowledge and video contexts, which is crucial for structured environment understanding and object-centric interactions, pivotal"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2407.11325","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2407.11325/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2407.11325","created_at":"2026-07-05T08:44:22.369010+00:00"},{"alias_kind":"arxiv_version","alias_value":"2407.11325v1","created_at":"2026-07-05T08:44:22.369010+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2407.11325","created_at":"2026-07-05T08:44:22.369010+00:00"},{"alias_kind":"pith_short_12","alias_value":"4EHNOXAFN7EX","created_at":"2026-07-05T08:44:22.369010+00:00"},{"alias_kind":"pith_short_16","alias_value":"4EHNOXAFN7EXKC2B","created_at":"2026-07-05T08:44:22.369010+00:00"},{"alias_kind":"pith_short_8","alias_value":"4EHNOXAF","created_at":"2026-07-05T08:44:22.369010+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2501.19201","citing_title":"Efficient Reasoning with Hidden Thinking","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2604.18665","citing_title":"APRVOS: 1st Place Winner of 5th PVUW MeViS-Audio Track","ref_index":23,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/4EHNOXAFN7EXKC2BTTG75735RV","json":"https://pith.science/pith/4EHNOXAFN7EXKC2BTTG75735RV.json","graph_json":"https://pith.science/api/pith-number/4EHNOXAFN7EXKC2BTTG75735RV/graph.json","events_json":"https://pith.science/api/pith-number/4EHNOXAFN7EXKC2BTTG75735RV/events.json","paper":"https://pith.science/paper/4EHNOXAF"},"agent_actions":{"view_html":"https://pith.science/pith/4EHNOXAFN7EXKC2BTTG75735RV","download_json":"https://pith.science/pith/4EHNOXAFN7EXKC2BTTG75735RV.json","view_paper":"https://pith.science/paper/4EHNOXAF","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2407.11325&json=true","fetch_graph":"https://pith.science/api/pith-number/4EHNOXAFN7EXKC2BTTG75735RV/graph.json","fetch_events":"https://pith.science/api/pith-number/4EHNOXAFN7EXKC2BTTG75735RV/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/4EHNOXAFN7EXKC2BTTG75735RV/action/timestamp_anchor","attest_storage":"https://pith.science/pith/4EHNOXAFN7EXKC2BTTG75735RV/action/storage_attestation","attest_author":"https://pith.science/pith/4EHNOXAFN7EXKC2BTTG75735RV/action/author_attestation","sign_citation":"https://pith.science/pith/4EHNOXAFN7EXKC2BTTG75735RV/action/citation_signature","submit_replication":"https://pith.science/pith/4EHNOXAFN7EXKC2BTTG75735RV/action/replication_record"}},"created_at":"2026-07-05T08:44:22.369010+00:00","updated_at":"2026-07-05T08:44:22.369010+00:00"}