Pith. sign in

Measuring massive multitask language understanding

5 Pith papers cite this work. Polarity classification is still indexing.

5 Pith papers citing it

citation-role summary

dataset 1

citation-polarity summary

years

2026 5

roles

dataset 1

polarities

use dataset 1

representative citing papers

Faithfulness to Refusal: A Causal Audit of Neuron Selectors

cs.CL · 2026-07-06 · conditional · novelty 6.0

A causal audit via neuron-row zeroing shows attribution methods (LRP, IG) faithfully identify dispensable neurons and can install refusal behavior, while rank-stability proxies systematically miss selector failures.

Robust LLM Watermarking with Minimal Semantic Distortion for IP Protection

cs.CR · 2026-05-22 · unverdicted · novelty 6.0

SAFESEAL is a key-conditioned LLM watermarking framework using tournament sampling for synonym substitution and a contrastive detector that reports 98.2% detection, 0.983 BERTScore, and 0.963 entity similarity while claiming robustness to attacks.

citing papers explorer

Showing 5 of 5 citing papers.