{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:M4U3XMFCOM76T6THQHWD4CO45A","short_pith_number":"pith:M4U3XMFC","schema_version":"1.0","canonical_sha256":"6729bbb0a2733fe9fa6781ec3e09dce83eaf57ce906d34211093c334e668a922","source":{"kind":"arxiv","id":"2409.19457","version":4},"attestation_state":"computed","paper":{"title":"A Parameter-Efficient Tuning Framework for Language-guided Object Grounding and Robot Grasping","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.RO","authors_text":"Alireza Rezazadeh, Changhyun Choi, Houjian Yu, Mingen Li, Yang Yang","submitted_at":"2024-09-28T21:11:25Z","abstract_excerpt":"The language-guided robot grasping task requires a robot agent to integrate multimodal information from both visual and linguistic inputs to predict actions for target-driven grasping. While recent approaches utilizing Multimodal Large Language Models (MLLMs) have shown promising results, their extensive computation and data demands limit the feasibility of local deployment and customization. To address this, we propose a novel CLIP-based multimodal parameter-efficient tuning (PET) framework designed for three language-guided object grounding and grasping tasks: (1) Referring Expression Segmen"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2409.19457","kind":"arxiv","version":4},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.RO","submitted_at":"2024-09-28T21:11:25Z","cross_cats_sorted":[],"title_canon_sha256":"60ef5d65c56642b5a9a6d7839531f80967ba5a613bef2c581600f57096fa625d","abstract_canon_sha256":"1ac7d5c81d9809f3e29507290fe90e25c6bfcc1e9d586bb39b40f50eb4cef225"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:10:44.331911Z","signature_b64":"1woYpGWLdJHloHtvehZunrnM0yi4DzykRDRQ5y+znqDx3leUuTipG7RjkPhbKQGZv4hRv8BQiDa+o0v/RmtGDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"6729bbb0a2733fe9fa6781ec3e09dce83eaf57ce906d34211093c334e668a922","last_reissued_at":"2026-07-05T10:10:44.331493Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:10:44.331493Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"A Parameter-Efficient Tuning Framework for Language-guided Object Grounding and Robot Grasping","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.RO","authors_text":"Alireza Rezazadeh, Changhyun Choi, Houjian Yu, Mingen Li, Yang Yang","submitted_at":"2024-09-28T21:11:25Z","abstract_excerpt":"The language-guided robot grasping task requires a robot agent to integrate multimodal information from both visual and linguistic inputs to predict actions for target-driven grasping. While recent approaches utilizing Multimodal Large Language Models (MLLMs) have shown promising results, their extensive computation and data demands limit the feasibility of local deployment and customization. To address this, we propose a novel CLIP-based multimodal parameter-efficient tuning (PET) framework designed for three language-guided object grounding and grasping tasks: (1) Referring Expression Segmen"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2409.19457","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2409.19457/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2409.19457","created_at":"2026-07-05T10:10:44.331550+00:00"},{"alias_kind":"arxiv_version","alias_value":"2409.19457v4","created_at":"2026-07-05T10:10:44.331550+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2409.19457","created_at":"2026-07-05T10:10:44.331550+00:00"},{"alias_kind":"pith_short_12","alias_value":"M4U3XMFCOM76","created_at":"2026-07-05T10:10:44.331550+00:00"},{"alias_kind":"pith_short_16","alias_value":"M4U3XMFCOM76T6TH","created_at":"2026-07-05T10:10:44.331550+00:00"},{"alias_kind":"pith_short_8","alias_value":"M4U3XMFC","created_at":"2026-07-05T10:10:44.331550+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2509.08126","citing_title":"Attribute-based Object Grounding and Robot Grasp Detection with Spatial Reasoning","ref_index":17,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/M4U3XMFCOM76T6THQHWD4CO45A","json":"https://pith.science/pith/M4U3XMFCOM76T6THQHWD4CO45A.json","graph_json":"https://pith.science/api/pith-number/M4U3XMFCOM76T6THQHWD4CO45A/graph.json","events_json":"https://pith.science/api/pith-number/M4U3XMFCOM76T6THQHWD4CO45A/events.json","paper":"https://pith.science/paper/M4U3XMFC"},"agent_actions":{"view_html":"https://pith.science/pith/M4U3XMFCOM76T6THQHWD4CO45A","download_json":"https://pith.science/pith/M4U3XMFCOM76T6THQHWD4CO45A.json","view_paper":"https://pith.science/paper/M4U3XMFC","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2409.19457&json=true","fetch_graph":"https://pith.science/api/pith-number/M4U3XMFCOM76T6THQHWD4CO45A/graph.json","fetch_events":"https://pith.science/api/pith-number/M4U3XMFCOM76T6THQHWD4CO45A/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/M4U3XMFCOM76T6THQHWD4CO45A/action/timestamp_anchor","attest_storage":"https://pith.science/pith/M4U3XMFCOM76T6THQHWD4CO45A/action/storage_attestation","attest_author":"https://pith.science/pith/M4U3XMFCOM76T6THQHWD4CO45A/action/author_attestation","sign_citation":"https://pith.science/pith/M4U3XMFCOM76T6THQHWD4CO45A/action/citation_signature","submit_replication":"https://pith.science/pith/M4U3XMFCOM76T6THQHWD4CO45A/action/replication_record"}},"created_at":"2026-07-05T10:10:44.331550+00:00","updated_at":"2026-07-05T10:10:44.331550+00:00"}