{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:EVK6RRMHK6QABA4QVC75P5VRQS","short_pith_number":"pith:EVK6RRMH","schema_version":"1.0","canonical_sha256":"2555e8c58757a0008390a8bfd7f6b184b5e59396d7a56047ab135d602cfd096a","source":{"kind":"arxiv","id":"2401.15585","version":1},"attestation_state":"computed","paper":{"title":"Evaluating Gender Bias in Large Language Models via Chain-of-Thought Prompting","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Danushka Bollegala, Masahiro Kaneko, Naoaki Okazaki, Timothy Baldwin","submitted_at":"2024-01-28T06:50:10Z","abstract_excerpt":"There exist both scalable tasks, like reading comprehension and fact-checking, where model performance improves with model size, and unscalable tasks, like arithmetic reasoning and symbolic reasoning, where model performance does not necessarily improve with model size. Large language models (LLMs) equipped with Chain-of-Thought (CoT) prompting are able to make accurate incremental predictions even on unscalable tasks. Unfortunately, despite their exceptional reasoning abilities, LLMs tend to internalize and reproduce discriminatory societal biases. Whether CoT can provide discriminatory or eg"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2401.15585","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2024-01-28T06:50:10Z","cross_cats_sorted":[],"title_canon_sha256":"01fc8eac8b4c7549d37a910868d0b2ecfc6a768bf38c762c6268f27cd085f784","abstract_canon_sha256":"29238c3ad1e01004a89ec45d5eaf214b0197030d26d7ede99e3679448640613d"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:38:37.224847Z","signature_b64":"Rzesse2BQYyo3J68yNj304PqVbnuPr9BteboAuO5vC5/QtJQrHwTnMVPCvvzyEGZlQoRYRqTx629PakoiMXjBQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"2555e8c58757a0008390a8bfd7f6b184b5e59396d7a56047ab135d602cfd096a","last_reissued_at":"2026-07-05T07:38:37.224384Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:38:37.224384Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Evaluating Gender Bias in Large Language Models via Chain-of-Thought Prompting","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Danushka Bollegala, Masahiro Kaneko, Naoaki Okazaki, Timothy Baldwin","submitted_at":"2024-01-28T06:50:10Z","abstract_excerpt":"There exist both scalable tasks, like reading comprehension and fact-checking, where model performance improves with model size, and unscalable tasks, like arithmetic reasoning and symbolic reasoning, where model performance does not necessarily improve with model size. Large language models (LLMs) equipped with Chain-of-Thought (CoT) prompting are able to make accurate incremental predictions even on unscalable tasks. Unfortunately, despite their exceptional reasoning abilities, LLMs tend to internalize and reproduce discriminatory societal biases. Whether CoT can provide discriminatory or eg"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2401.15585","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2401.15585/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2401.15585","created_at":"2026-07-05T07:38:37.224442+00:00"},{"alias_kind":"arxiv_version","alias_value":"2401.15585v1","created_at":"2026-07-05T07:38:37.224442+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2401.15585","created_at":"2026-07-05T07:38:37.224442+00:00"},{"alias_kind":"pith_short_12","alias_value":"EVK6RRMHK6QA","created_at":"2026-07-05T07:38:37.224442+00:00"},{"alias_kind":"pith_short_16","alias_value":"EVK6RRMHK6QABA4Q","created_at":"2026-07-05T07:38:37.224442+00:00"},{"alias_kind":"pith_short_8","alias_value":"EVK6RRMH","created_at":"2026-07-05T07:38:37.224442+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2510.17062","citing_title":"Investigating Thinking Behaviours of Reasoning-Based Language Models for Social Bias Mitigation","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02601","citing_title":"SemEval-2026 Task 7: Everyday Knowledge Across Diverse Languages and Cultures","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02640","citing_title":"Trustworthy AI Suffers from Invariance Conflicts and Causality is The Solution","ref_index":14,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/EVK6RRMHK6QABA4QVC75P5VRQS","json":"https://pith.science/pith/EVK6RRMHK6QABA4QVC75P5VRQS.json","graph_json":"https://pith.science/api/pith-number/EVK6RRMHK6QABA4QVC75P5VRQS/graph.json","events_json":"https://pith.science/api/pith-number/EVK6RRMHK6QABA4QVC75P5VRQS/events.json","paper":"https://pith.science/paper/EVK6RRMH"},"agent_actions":{"view_html":"https://pith.science/pith/EVK6RRMHK6QABA4QVC75P5VRQS","download_json":"https://pith.science/pith/EVK6RRMHK6QABA4QVC75P5VRQS.json","view_paper":"https://pith.science/paper/EVK6RRMH","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2401.15585&json=true","fetch_graph":"https://pith.science/api/pith-number/EVK6RRMHK6QABA4QVC75P5VRQS/graph.json","fetch_events":"https://pith.science/api/pith-number/EVK6RRMHK6QABA4QVC75P5VRQS/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/EVK6RRMHK6QABA4QVC75P5VRQS/action/timestamp_anchor","attest_storage":"https://pith.science/pith/EVK6RRMHK6QABA4QVC75P5VRQS/action/storage_attestation","attest_author":"https://pith.science/pith/EVK6RRMHK6QABA4QVC75P5VRQS/action/author_attestation","sign_citation":"https://pith.science/pith/EVK6RRMHK6QABA4QVC75P5VRQS/action/citation_signature","submit_replication":"https://pith.science/pith/EVK6RRMHK6QABA4QVC75P5VRQS/action/replication_record"}},"created_at":"2026-07-05T07:38:37.224442+00:00","updated_at":"2026-07-05T07:38:37.224442+00:00"}