{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:SH7NQG4JBOZDLALJCMBH2ANGDR","short_pith_number":"pith:SH7NQG4J","schema_version":"1.0","canonical_sha256":"91fed81b890bb235816913027d01a61c7160eeef8e0115d4abcc0bd5b339748c","source":{"kind":"arxiv","id":"2511.06160","version":2},"attestation_state":"computed","paper":{"title":"Evaluating Implicit Biases in LLM Reasoning through Logic Grid Puzzles","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL","cs.CY"],"primary_cat":"cs.AI","authors_text":"Fatima Jahara, Mark Dredze, Sharon Levy","submitted_at":"2025-11-08T22:51:59Z","abstract_excerpt":"While recent safety guardrails effectively suppress overtly biased outputs, subtler forms of social bias emerge during complex logical reasoning tasks that evade current evaluation benchmarks. To fill this gap, we introduce a new evaluation framework, PRIME (Puzzle Reasoning for Implicit Biases in Model Evaluation), that uses logic grid puzzles to systematically probe the influence of social stereotypes on logical reasoning and decision making in LLMs. Our use of logic puzzles enables automatic generation and verification, as well as variability in complexity and biased settings. PRIME include"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2511.06160","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.AI","submitted_at":"2025-11-08T22:51:59Z","cross_cats_sorted":["cs.CL","cs.CY"],"title_canon_sha256":"a3d2ba12e1ffbc51300779fa891a3894341bfe9a367e99b14bc336c02f57eedd","abstract_canon_sha256":"f243956edda0d8702f0e5476c590ca4b7a22b69f45c1efb4f949d85cf622883c"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-02T00:18:26.027435Z","signature_b64":"tfdwS2X78C3NtNYivDxa0hvegyQ0EZpMZSbpmar+d1Ujxz6WQPs5n5e+dazuwaNjA/zwELXRngM3L68vwq3aBQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"91fed81b890bb235816913027d01a61c7160eeef8e0115d4abcc0bd5b339748c","last_reissued_at":"2026-07-02T00:18:26.026732Z","signature_status":"signed_v1","first_computed_at":"2026-07-02T00:18:26.026732Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Evaluating Implicit Biases in LLM Reasoning through Logic Grid Puzzles","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.CL","cs.CY"],"primary_cat":"cs.AI","authors_text":"Fatima Jahara, Mark Dredze, Sharon Levy","submitted_at":"2025-11-08T22:51:59Z","abstract_excerpt":"While recent safety guardrails effectively suppress overtly biased outputs, subtler forms of social bias emerge during complex logical reasoning tasks that evade current evaluation benchmarks. To fill this gap, we introduce a new evaluation framework, PRIME (Puzzle Reasoning for Implicit Biases in Model Evaluation), that uses logic grid puzzles to systematically probe the influence of social stereotypes on logical reasoning and decision making in LLMs. Our use of logic puzzles enables automatic generation and verification, as well as variability in complexity and biased settings. PRIME include"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2511.06160","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2511.06160/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2511.06160","created_at":"2026-07-02T00:18:26.026825+00:00"},{"alias_kind":"arxiv_version","alias_value":"2511.06160v2","created_at":"2026-07-02T00:18:26.026825+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2511.06160","created_at":"2026-07-02T00:18:26.026825+00:00"},{"alias_kind":"pith_short_12","alias_value":"SH7NQG4JBOZD","created_at":"2026-07-02T00:18:26.026825+00:00"},{"alias_kind":"pith_short_16","alias_value":"SH7NQG4JBOZDLALJ","created_at":"2026-07-02T00:18:26.026825+00:00"},{"alias_kind":"pith_short_8","alias_value":"SH7NQG4J","created_at":"2026-07-02T00:18:26.026825+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/SH7NQG4JBOZDLALJCMBH2ANGDR","json":"https://pith.science/pith/SH7NQG4JBOZDLALJCMBH2ANGDR.json","graph_json":"https://pith.science/api/pith-number/SH7NQG4JBOZDLALJCMBH2ANGDR/graph.json","events_json":"https://pith.science/api/pith-number/SH7NQG4JBOZDLALJCMBH2ANGDR/events.json","paper":"https://pith.science/paper/SH7NQG4J"},"agent_actions":{"view_html":"https://pith.science/pith/SH7NQG4JBOZDLALJCMBH2ANGDR","download_json":"https://pith.science/pith/SH7NQG4JBOZDLALJCMBH2ANGDR.json","view_paper":"https://pith.science/paper/SH7NQG4J","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2511.06160&json=true","fetch_graph":"https://pith.science/api/pith-number/SH7NQG4JBOZDLALJCMBH2ANGDR/graph.json","fetch_events":"https://pith.science/api/pith-number/SH7NQG4JBOZDLALJCMBH2ANGDR/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/SH7NQG4JBOZDLALJCMBH2ANGDR/action/timestamp_anchor","attest_storage":"https://pith.science/pith/SH7NQG4JBOZDLALJCMBH2ANGDR/action/storage_attestation","attest_author":"https://pith.science/pith/SH7NQG4JBOZDLALJCMBH2ANGDR/action/author_attestation","sign_citation":"https://pith.science/pith/SH7NQG4JBOZDLALJCMBH2ANGDR/action/citation_signature","submit_replication":"https://pith.science/pith/SH7NQG4JBOZDLALJCMBH2ANGDR/action/replication_record"}},"created_at":"2026-07-02T00:18:26.026825+00:00","updated_at":"2026-07-02T00:18:26.026825+00:00"}