{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:U5JAIZQWVEYTJUPB4PBW6HZ3SN","short_pith_number":"pith:U5JAIZQW","schema_version":"1.0","canonical_sha256":"a752046616a93134d1e1e3c36f1f3b9368e99f86e3cc522baa67fc345851839a","source":{"kind":"arxiv","id":"2506.07196","version":2},"attestation_state":"computed","paper":{"title":"SAP-Bench: Benchmarking Multimodal Large Language Models in Surgical Action Planning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CV","authors_text":"Dillan Imans, Mengya Xu, Qi Dou, Xiaofan Zhang, Yiru Ye, Zhongzhen Huang","submitted_at":"2025-06-08T15:30:04Z","abstract_excerpt":"Effective evaluation is critical for driving advancements in MLLM research. The surgical action planning (SAP) task, which aims to generate future action sequences from visual inputs, demands precise and sophisticated analytical capabilities. Unlike mathematical reasoning, surgical decision-making operates in life-critical domains and requires meticulous, verifiable processes to ensure reliability and patient safety. This task demands the ability to distinguish between atomic visual actions and coordinate complex, long-horizon procedures, capabilities that are inadequately evaluated by current"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2506.07196","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-06-08T15:30:04Z","cross_cats_sorted":["cs.CL"],"title_canon_sha256":"ab7db7f9fde13e43226f622665bcdcf4bac9a0915e76bdc5dd715484d41703ad","abstract_canon_sha256":"27fd7c26f1d9f4bc87fbac943fd45fdc6d29b65234dc00ee68ec6bd2bd1a31c6"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:20:55.692540Z","signature_b64":"jjODlVTY+vS/6wXEeG8RZBP/1sjsRyOiXsqtHAk5/BNekOboqa++R1ML+X7vrF28/vGfXlHPWy6ZDTzn49b5Aw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"a752046616a93134d1e1e3c36f1f3b9368e99f86e3cc522baa67fc345851839a","last_reissued_at":"2026-07-05T11:20:55.692083Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:20:55.692083Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"SAP-Bench: Benchmarking Multimodal Large Language Models in Surgical Action Planning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.CV","authors_text":"Dillan Imans, Mengya Xu, Qi Dou, Xiaofan Zhang, Yiru Ye, Zhongzhen Huang","submitted_at":"2025-06-08T15:30:04Z","abstract_excerpt":"Effective evaluation is critical for driving advancements in MLLM research. The surgical action planning (SAP) task, which aims to generate future action sequences from visual inputs, demands precise and sophisticated analytical capabilities. Unlike mathematical reasoning, surgical decision-making operates in life-critical domains and requires meticulous, verifiable processes to ensure reliability and patient safety. This task demands the ability to distinguish between atomic visual actions and coordinate complex, long-horizon procedures, capabilities that are inadequately evaluated by current"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2506.07196","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2506.07196/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2506.07196","created_at":"2026-07-05T11:20:55.692139+00:00"},{"alias_kind":"arxiv_version","alias_value":"2506.07196v2","created_at":"2026-07-05T11:20:55.692139+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2506.07196","created_at":"2026-07-05T11:20:55.692139+00:00"},{"alias_kind":"pith_short_12","alias_value":"U5JAIZQWVEYT","created_at":"2026-07-05T11:20:55.692139+00:00"},{"alias_kind":"pith_short_16","alias_value":"U5JAIZQWVEYTJUPB","created_at":"2026-07-05T11:20:55.692139+00:00"},{"alias_kind":"pith_short_8","alias_value":"U5JAIZQW","created_at":"2026-07-05T11:20:55.692139+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/U5JAIZQWVEYTJUPB4PBW6HZ3SN","json":"https://pith.science/pith/U5JAIZQWVEYTJUPB4PBW6HZ3SN.json","graph_json":"https://pith.science/api/pith-number/U5JAIZQWVEYTJUPB4PBW6HZ3SN/graph.json","events_json":"https://pith.science/api/pith-number/U5JAIZQWVEYTJUPB4PBW6HZ3SN/events.json","paper":"https://pith.science/paper/U5JAIZQW"},"agent_actions":{"view_html":"https://pith.science/pith/U5JAIZQWVEYTJUPB4PBW6HZ3SN","download_json":"https://pith.science/pith/U5JAIZQWVEYTJUPB4PBW6HZ3SN.json","view_paper":"https://pith.science/paper/U5JAIZQW","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2506.07196&json=true","fetch_graph":"https://pith.science/api/pith-number/U5JAIZQWVEYTJUPB4PBW6HZ3SN/graph.json","fetch_events":"https://pith.science/api/pith-number/U5JAIZQWVEYTJUPB4PBW6HZ3SN/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/U5JAIZQWVEYTJUPB4PBW6HZ3SN/action/timestamp_anchor","attest_storage":"https://pith.science/pith/U5JAIZQWVEYTJUPB4PBW6HZ3SN/action/storage_attestation","attest_author":"https://pith.science/pith/U5JAIZQWVEYTJUPB4PBW6HZ3SN/action/author_attestation","sign_citation":"https://pith.science/pith/U5JAIZQWVEYTJUPB4PBW6HZ3SN/action/citation_signature","submit_replication":"https://pith.science/pith/U5JAIZQWVEYTJUPB4PBW6HZ3SN/action/replication_record"}},"created_at":"2026-07-05T11:20:55.692139+00:00","updated_at":"2026-07-05T11:20:55.692139+00:00"}