{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:CDKMB7NBF66N554P2XWO5J3OXL","short_pith_number":"pith:CDKMB7NB","schema_version":"1.0","canonical_sha256":"10d4c0fda12fbcdef78fd5eceea76ebaffc049cbd20b960e6f8559206e133fd8","source":{"kind":"arxiv","id":"2406.04823","version":2},"attestation_state":"computed","paper":{"title":"BERTs are Generative In-Context Learners","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"David Samuel","submitted_at":"2024-06-07T10:48:45Z","abstract_excerpt":"While in-context learning is commonly associated with causal language models, such as GPT, we demonstrate that this capability also 'emerges' in masked language models. Through an embarrassingly simple inference technique, we enable an existing masked model, DeBERTa, to perform generative tasks without additional training or architectural changes. Our evaluation reveals that the masked and causal language models behave very differently, as they clearly outperform each other on different categories of tasks. These complementary strengths suggest that the field's focus on causal models for in-co"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2406.04823","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2024-06-07T10:48:45Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"921020177fcd5c9530a70c922513022922ac2d7d9c3b69050e95c8aebab54cee","abstract_canon_sha256":"9e5a0518cffd6428ea4645cc9332cc79f428959c4923b9ea7d38348a9ff9dd42"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:29:14.769104Z","signature_b64":"nzK66w0wIYBmeIOU7Hcu/kT7BIgj8ojTm9eAUcORkw87ZRlK651GLyNI4j/e61YWg6iBWsCaQfv4AJU/t+0EAg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"10d4c0fda12fbcdef78fd5eceea76ebaffc049cbd20b960e6f8559206e133fd8","last_reissued_at":"2026-07-05T09:29:14.768637Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:29:14.768637Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"BERTs are Generative In-Context Learners","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"David Samuel","submitted_at":"2024-06-07T10:48:45Z","abstract_excerpt":"While in-context learning is commonly associated with causal language models, such as GPT, we demonstrate that this capability also 'emerges' in masked language models. Through an embarrassingly simple inference technique, we enable an existing masked model, DeBERTa, to perform generative tasks without additional training or architectural changes. Our evaluation reveals that the masked and causal language models behave very differently, as they clearly outperform each other on different categories of tasks. These complementary strengths suggest that the field's focus on causal models for in-co"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2406.04823","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2406.04823/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2406.04823","created_at":"2026-07-05T09:29:14.768694+00:00"},{"alias_kind":"arxiv_version","alias_value":"2406.04823v2","created_at":"2026-07-05T09:29:14.768694+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2406.04823","created_at":"2026-07-05T09:29:14.768694+00:00"},{"alias_kind":"pith_short_12","alias_value":"CDKMB7NBF66N","created_at":"2026-07-05T09:29:14.768694+00:00"},{"alias_kind":"pith_short_16","alias_value":"CDKMB7NBF66N554P","created_at":"2026-07-05T09:29:14.768694+00:00"},{"alias_kind":"pith_short_8","alias_value":"CDKMB7NB","created_at":"2026-07-05T09:29:14.768694+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2412.13663","citing_title":"Smarter, Better, Faster, Longer: A Modern Bidirectional Encoder for Fast, Memory Efficient, and Long Context Finetuning and Inference","ref_index":179,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/CDKMB7NBF66N554P2XWO5J3OXL","json":"https://pith.science/pith/CDKMB7NBF66N554P2XWO5J3OXL.json","graph_json":"https://pith.science/api/pith-number/CDKMB7NBF66N554P2XWO5J3OXL/graph.json","events_json":"https://pith.science/api/pith-number/CDKMB7NBF66N554P2XWO5J3OXL/events.json","paper":"https://pith.science/paper/CDKMB7NB"},"agent_actions":{"view_html":"https://pith.science/pith/CDKMB7NBF66N554P2XWO5J3OXL","download_json":"https://pith.science/pith/CDKMB7NBF66N554P2XWO5J3OXL.json","view_paper":"https://pith.science/paper/CDKMB7NB","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2406.04823&json=true","fetch_graph":"https://pith.science/api/pith-number/CDKMB7NBF66N554P2XWO5J3OXL/graph.json","fetch_events":"https://pith.science/api/pith-number/CDKMB7NBF66N554P2XWO5J3OXL/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/CDKMB7NBF66N554P2XWO5J3OXL/action/timestamp_anchor","attest_storage":"https://pith.science/pith/CDKMB7NBF66N554P2XWO5J3OXL/action/storage_attestation","attest_author":"https://pith.science/pith/CDKMB7NBF66N554P2XWO5J3OXL/action/author_attestation","sign_citation":"https://pith.science/pith/CDKMB7NBF66N554P2XWO5J3OXL/action/citation_signature","submit_replication":"https://pith.science/pith/CDKMB7NBF66N554P2XWO5J3OXL/action/replication_record"}},"created_at":"2026-07-05T09:29:14.768694+00:00","updated_at":"2026-07-05T09:29:14.768694+00:00"}