{"bundle_type":"pith_open_graph_bundle","bundle_version":"1.0","pith_number":"pith:2023:CW3TOYMT72UNXLODAIDIYOIHIE","short_pith_number":"pith:CW3TOYMT","canonical_record":{"source":{"id":"2303.08774","kind":"arxiv","version":6},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2023-03-15T17:15:04Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"b7c6bfa5b34eb7b67fa8828a4cffa53037421fd4bb13a7901ff93c758a5cc5a3","abstract_canon_sha256":"77a5f47746902cfcda0d758adebcd4d56e76e6eb0c9ed4ed3ae0cee61105914c"},"schema_version":"1.0"},"canonical_sha256":"15b7376193fea8dbadc302068c39074108da6fbb7700682e9ffba5f6f9e9990b","source":{"kind":"arxiv","id":"2303.08774","version":6},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2303.08774","created_at":"2026-07-05T07:53:29Z"},{"alias_kind":"arxiv_version","alias_value":"2303.08774v6","created_at":"2026-07-05T07:53:29Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2303.08774","created_at":"2026-07-05T07:53:29Z"},{"alias_kind":"pith_short_12","alias_value":"CW3TOYMT72UN","created_at":"2026-07-05T07:53:29Z"},{"alias_kind":"pith_short_16","alias_value":"CW3TOYMT72UNXLOD","created_at":"2026-07-05T07:53:29Z"},{"alias_kind":"pith_short_8","alias_value":"CW3TOYMT","created_at":"2026-07-05T07:53:29Z"}],"events":[{"event_type":"record_created","subject_pith_number":"pith:2023:CW3TOYMT72UNXLODAIDIYOIHIE","target":"record","payload":{"canonical_record":{"source":{"id":"2303.08774","kind":"arxiv","version":6},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2023-03-15T17:15:04Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"b7c6bfa5b34eb7b67fa8828a4cffa53037421fd4bb13a7901ff93c758a5cc5a3","abstract_canon_sha256":"77a5f47746902cfcda0d758adebcd4d56e76e6eb0c9ed4ed3ae0cee61105914c"},"schema_version":"1.0"},"canonical_sha256":"15b7376193fea8dbadc302068c39074108da6fbb7700682e9ffba5f6f9e9990b","receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:53:29.835918Z","signature_b64":"hCcKaukEpS2ST5UcJvNOUl8sNMY7VVlSPaLqwqstGEhQa2R6vxoMjhShEognmgRWFa7rbUt1oC9yswl6K3HEAg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"15b7376193fea8dbadc302068c39074108da6fbb7700682e9ffba5f6f9e9990b","last_reissued_at":"2026-07-05T07:53:29.835446Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:53:29.835446Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"source_kind":"arxiv","source_id":"2303.08774","source_version":6,"attestation_state":"computed"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T07:53:29Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"DIQJk9BUOXQ5KRKlkv4D+/sTU95aqQKdG/4+PlGXVN2Vny7vf4lF2N0DxndPzdj4XQuPCIbhoxGhVX1KEzshDg==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-04T08:04:20.310780Z"},"content_sha256":"93672c56acee9869a988d00752f38a56e5724d826f114399b473bb3ac3bc87d3","schema_version":"1.0","event_id":"sha256:93672c56acee9869a988d00752f38a56e5724d826f114399b473bb3ac3bc87d3"},{"event_type":"graph_snapshot","subject_pith_number":"pith:2023:CW3TOYMT72UNXLODAIDIYOIHIE","target":"graph","payload":{"graph_snapshot":{"paper":{"title":"GPT-4 Technical Report","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"GPT-4 reaches human-level scores on professional benchmarks such as a simulated bar exam through scalable training methods.","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Aalok Mehta, Adam Perelman, Aditya Ramesh, Adrien Ecoffet, Akila Welihinda, Alan Hickey, Alec Radford, Alethea Power, Alex Paino, Alex Passos, Ali Kamali, Alvin Wang, Amin Tootoonchian, Andrea Vallone, Andrew Cann, Andrew Kondrich, Andrew Mayne, Andrew Peng, Andrey Mishchenko, Angela Jiang, Anna-Luisa Brakman, Anna Makanju, Aris Konstantinidis, Arka Dhar, Arun Vijayvergiya, Arvind Neelakantan, Ashley Pantuliano, Ashvin Nair, Atty Eleti, Barret Zoph, Ben Chess, Benjamin Sokolowsky, Ben Wang, Bianca Martin, Billie Jonn, Bob McGrew, Bob Rotsted, Boris Power, Brandon Houghton, Brittany Carey, Brooke Chan, Cameron Raymond, Carl Ross, Carroll Wainwright, Casey Chu, Chak Ming Li, Che Chang, Chelsea Carlson, Chelsea Voss, Chester Cho, Chong Zhang, Chris Hallacy, Chris Hesse, Christian Gibson, Christina Kim, Christine McLeavey, Christopher Berner, CJ Weinmann, Clemens Winter, Cory Decareaux, Cullen O'Keefe, Damien Deville, Daniel Kokotajlo, Daniel Levy, Daniel Mossing, Daniel Selsam, Dave Cummings, Dave Willner, David Dohan, David Farhi, David Medina, David M\\'ely, David Schnurr, Denny Jin, Derek Chen, Diogo Almeida, Elie Georges, Elizabeth Proehl, Elizabeth Tseng, Emy Parparita, Eric Sigler, Evan Morikawa, Felipe Petroski Such, Filipe de Avila Belbute Peres, Florencia Leoni Aleman, Fotis Chantzis, Francis Real, Gabriel Bernadett-Shapiro, Gabriel Goh, Giambattista Parascandolo, Girish Sastry, Greg Brockman, Gretchen Krueger, Haiming Bao, Hannah Wong, Haozhun Jin, Heather Schmidt, Heewoo Jun, Henrique Ponde de Oliveira Pinto, Henri Roussez, Hyeonwoo Noh, Hyung Won Chung, Ian Sohl, Igor Babuschkin, Ikai Lan, Ilge Akkaya, Ilya Sutskever, Ingmar Kanitscheider, Irwan Bello, Isabella Fulford, Jack Rae, Jacob Menick, Jade Leung, Jake Berdine, Jake McNeil, Jakub Pachocki, Jamie Kiros, Jan Hendrik Kirchner, Janko Altenschmidt, Jan Leike, Jason Chen, Jason Wei, Jeff Belgum, Jeff Harris, Jeff Wu, Jeremiah Currier, Jerry Tworek, Jesse Han, Jessica Shieh, Jiayi Weng, Jie Tang, Joanne Jang, Joel Parish, Joe Palermo, Johannes Heidecke, John Schulman, Jonathan Gordon, Jonathan Ward, Jong Wook Kim, Joost Huizinga, Jordan Sitkin, Josh Achiam, Joshua Gross, Juan Felipe Cer\\'on Uribe, Juntang Zhuang, Justin Jay Wang, Juston Forte, Kai Xiao, Katarina Slama, Katie Mayer, Kendra Rimbach, Kenny Hsu, Kevin Button, Kevin Yu, Kim Malfacini, Kyla Sheppard, Kyle Kosic, Lama Ahmad, Lauren Workman, Lenny Bogdonoff, Leo Gao, Liam Fedus, Lilian Weng, Logan Kilpatrick, Long Ouyang, {\\L}ukasz Kaiser, {\\L}ukasz Kondraciuk, Luke Metz, Maddie Simens, Madelaine Boyd, Madeleine B. Thompson, Mario Saltarelli, Mark Chen, Marvin Zhang, Mateusz Litwin, Matt Knight, Matt Wiethoff, Michael Lampe, Michael Petrov, Michael (Rai) Pokorny, Michael Wu, Michelle Pokrass, Mike Heaton, Mikhail Pavlov, Miles Brundage, Mira Murati, Mohammad Bavarian, Molly Lin, Morgan Grafstein, Natalie Staudacher, Natalie Summers, Nick Ryder, Nick Turley, Niko Felix, Nikolas Tezak, Nitish Shirish Keskar, Noah Deutsch, Oleg Boiko, Oleg Murk, OpenAI, Pamela Mishkin, Patricia Lue, Paul Baltescu, Paul McMillan, Peter Hoeschele, Peter Welinder, Phil Tillet, Pranav Shyam, Preston Tuggle, Qiming Yuan, Rachel Lim, Rajeev Nayak, Rapha Gontijo-Lopes, Raul Puri, Red Avila, Reiichiro Nakano, Richard Ngo, Roger Jiang, Rory Carmichael, Rosie Campbell, Rowan Zellers, Ruby Chen, Ryan Greene, Ryan Lowe, Sam Altman, Sam Manning, Samuel Wolrich, Sandhini Agarwal, Sarah Shoker, Sarah Yoo, Scott Gray, Scott Mayer McKinney, Shantanu Jain, Shawn Jain, Sheila Dunning, Shengjia Zhao, Shengli Hu, Sherwin Wu, Shibani Santurkar, Shino Jomoto, Shixiang Shane Gu, Shyamal Anadkat, Sim\\'on Posada Fishman, Stephanie Lin, Steve Dowling, Steven Adler, Suchir Balaji, Sully Chen, Szymon Sidor, Tabarak Khan, Tao Xu, Tarun Gogineni, Teddy Lee, Ted Sanders, Theresa Lopez, Thomas Degry, Tianhao Zheng, Tim Brooks, Todor Markov, Toki Sherbakov, Tolly Powell, Tomer Kaftan, Tong Mu, Trevor Cai, Tyna Eloundou, Valerie Balcom, Vik Goel, Vinnie Monaco, Vishal Kuo, Vitchyr H. Pong, Wade Hickey, William Zhuk, Wojciech Zaremba, Xin Hu, Yang Song, Yaniv Markovski, Yongjik Kim, Yuchen He, Yufei Guo, Yunxing Dai","submitted_at":"2023-03-15T17:15:04Z","abstract_excerpt":"We report the development of GPT-4, a large-scale, multimodal model which can accept image and text inputs and produce text outputs. While less capable than humans in many real-world scenarios, GPT-4 exhibits human-level performance on various professional and academic benchmarks, including passing a simulated bar exam with a score around the top 10% of test takers. GPT-4 is a Transformer-based model pre-trained to predict the next token in a document. The post-training alignment process results in improved performance on measures of factuality and adherence to desired behavior. A core compone"},"claims":{"count":4,"items":[{"kind":"strongest_claim","text":"GPT-4 exhibits human-level performance on various professional and academic benchmarks, including passing a simulated bar exam with a score around the top 10% of test takers.","source":"verdict.strongest_claim","status":"machine_extracted","claim_id":"C1","attestation":"unclaimed"},{"kind":"weakest_assumption","text":"The reported benchmark scores reflect genuine generalization rather than test contamination, prompt engineering, or post-hoc selection of evaluation conditions (location: abstract, performance claims paragraph).","source":"verdict.weakest_assumption","status":"machine_extracted","claim_id":"C2","attestation":"unclaimed"},{"kind":"one_line_summary","text":"GPT-4 is a scaled Transformer model with post-training alignment that reaches human-level performance on academic and professional benchmarks via infrastructure enabling performance prediction from much smaller models.","source":"verdict.one_line_summary","status":"machine_extracted","claim_id":"C3","attestation":"unclaimed"},{"kind":"headline","text":"GPT-4 reaches human-level scores on professional benchmarks such as a simulated bar exam through scalable training methods.","source":"verdict.pith_extraction.headline","status":"machine_extracted","claim_id":"C4","attestation":"unclaimed"}],"snapshot_sha256":"4fc32b75b846a64b621599b6d1c4703d73e3aadf25954808850356b604779b89"},"source":{"id":"2303.08774","kind":"arxiv","version":6},"verdict":{"id":"9e8e6f7d-00e4-48aa-be5d-c14787c4ed7c","model_set":{"reader":"grok-4.3"},"created_at":"2026-05-24T09:45:00.842036Z","strongest_claim":"GPT-4 exhibits human-level performance on various professional and academic benchmarks, including passing a simulated bar exam with a score around the top 10% of test takers.","one_line_summary":"GPT-4 is a scaled Transformer model with post-training alignment that reaches human-level performance on academic and professional benchmarks via infrastructure enabling performance prediction from much smaller models.","pipeline_version":"pith-pipeline@v0.9.0","weakest_assumption":"The reported benchmark scores reflect genuine generalization rather than test contamination, prompt engineering, or post-hoc selection of evaluation conditions (location: abstract, performance claims paragraph).","pith_extraction_headline":"GPT-4 reaches human-level scores on professional benchmarks such as a simulated bar exam through scalable training methods."},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2303.08774/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":128,"sample":[{"doi":"","year":2021,"title":"Understanding the Capabilities, Limita- tions, and Societal Impact of Large Language Models","work_id":"1689904b-5b09-4173-b2f5-2db66cdb6e35","ref_index":1,"cited_arxiv_id":"","is_internal_anchor":false},{"doi":"","year":null,"title":"Introducing the new Bing","work_id":"f9b2e988-29db-4d04-a636-5d1f52919c21","ref_index":2,"cited_arxiv_id":"","is_internal_anchor":false},{"doi":"","year":2021,"title":"WebGPT: Improving the factual accuracy of language models through web browsing","work_id":"ddff12fd-29cc-4868-beaa-965b68d09703","ref_index":3,"cited_arxiv_id":"","is_internal_anchor":false},{"doi":"","year":null,"title":"ACT-1: Transformer for Actions – Adept","work_id":"ac6b7be2-5452-4e30-9ea4-13e39eeb8eeb","ref_index":4,"cited_arxiv_id":"","is_internal_anchor":false},{"doi":"","year":2021,"title":"Evaluating Large Language Models Trained on Code","work_id":"8dd0b362-ac5a-4739-a79a-039cb586a048","ref_index":5,"cited_arxiv_id":"","is_internal_anchor":false}],"resolved_work":128,"snapshot_sha256":"2807ebe710808065d36b616e7c6c753a4b40a15fd68bd97342c00a094361d4a4","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"verdict_id":"9e8e6f7d-00e4-48aa-be5d-c14787c4ed7c"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T07:53:29Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"Vtfte69MEHefS9sx0lvf5FDWk6pHS3jpsbgyk6th91M0VPDV3PV7/Rz+PDguR0oRQPUr1hIRQ7TryDuDp2cgBg==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-04T08:04:20.313584Z"},"content_sha256":"18dc6f3dc69f7ce7a730fb261cde78fb88ac6135f9a92970e474bbbfc3e9eaef","schema_version":"1.0","event_id":"sha256:18dc6f3dc69f7ce7a730fb261cde78fb88ac6135f9a92970e474bbbfc3e9eaef"}],"timestamp_proofs":[],"mirror_hints":[{"mirror_type":"https","name":"Pith Resolver","base_url":"https://pith.science","bundle_url":"https://pith.science/pith/CW3TOYMT72UNXLODAIDIYOIHIE/bundle.json","state_url":"https://pith.science/pith/CW3TOYMT72UNXLODAIDIYOIHIE/state.json","well_known_bundle_url":"https://pith.science/.well-known/pith/CW3TOYMT72UNXLODAIDIYOIHIE/bundle.json","status":"primary"}],"public_keys":[{"key_id":"pith-v1-2026-05","algorithm":"ed25519","format":"raw","public_key_b64":"stVStoiQhXFxp4s2pdzPNoqVNBMojDU/fJ2db5S3CbM=","public_key_hex":"b2d552b68890857171a78b36a5dccf368a953413288c353f7c9d9d6f94b709b3","fingerprint_sha256_b32_first128bits":"RVFV5Z2OI2J3ZUO7ERDEBCYNKS","fingerprint_sha256_hex":"8d4b5ee74e4693bcd1df2446408b0d54","rotates_at":null,"url":"https://pith.science/pith-signing-key.json","notes":"Pith uses this Ed25519 key to sign canonical record SHA-256 digests. Verify with: ed25519_verify(public_key, message=canonical_sha256_bytes, signature=base64decode(signature_b64))."}],"merge_version":"pith-open-graph-merge-v1","built_at":"2026-08-04T08:04:20Z","links":{"resolver":"https://pith.science/pith/CW3TOYMT72UNXLODAIDIYOIHIE","bundle":"https://pith.science/pith/CW3TOYMT72UNXLODAIDIYOIHIE/bundle.json","state":"https://pith.science/pith/CW3TOYMT72UNXLODAIDIYOIHIE/state.json","well_known_bundle":"https://pith.science/.well-known/pith/CW3TOYMT72UNXLODAIDIYOIHIE/bundle.json"},"state":{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2023:CW3TOYMT72UNXLODAIDIYOIHIE","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"77a5f47746902cfcda0d758adebcd4d56e76e6eb0c9ed4ed3ae0cee61105914c","cross_cats_sorted":["cs.AI"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2023-03-15T17:15:04Z","title_canon_sha256":"b7c6bfa5b34eb7b67fa8828a4cffa53037421fd4bb13a7901ff93c758a5cc5a3"},"schema_version":"1.0","source":{"id":"2303.08774","kind":"arxiv","version":6}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2303.08774","created_at":"2026-07-05T07:53:29Z"},{"alias_kind":"arxiv_version","alias_value":"2303.08774v6","created_at":"2026-07-05T07:53:29Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2303.08774","created_at":"2026-07-05T07:53:29Z"},{"alias_kind":"pith_short_12","alias_value":"CW3TOYMT72UN","created_at":"2026-07-05T07:53:29Z"},{"alias_kind":"pith_short_16","alias_value":"CW3TOYMT72UNXLOD","created_at":"2026-07-05T07:53:29Z"},{"alias_kind":"pith_short_8","alias_value":"CW3TOYMT","created_at":"2026-07-05T07:53:29Z"}],"graph_snapshots":[{"event_id":"sha256:18dc6f3dc69f7ce7a730fb261cde78fb88ac6135f9a92970e474bbbfc3e9eaef","target":"graph","created_at":"2026-07-05T07:53:29Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":4,"items":[{"attestation":"unclaimed","claim_id":"C1","kind":"strongest_claim","source":"verdict.strongest_claim","status":"machine_extracted","text":"GPT-4 exhibits human-level performance on various professional and academic benchmarks, including passing a simulated bar exam with a score around the top 10% of test takers."},{"attestation":"unclaimed","claim_id":"C2","kind":"weakest_assumption","source":"verdict.weakest_assumption","status":"machine_extracted","text":"The reported benchmark scores reflect genuine generalization rather than test contamination, prompt engineering, or post-hoc selection of evaluation conditions (location: abstract, performance claims paragraph)."},{"attestation":"unclaimed","claim_id":"C3","kind":"one_line_summary","source":"verdict.one_line_summary","status":"machine_extracted","text":"GPT-4 is a scaled Transformer model with post-training alignment that reaches human-level performance on academic and professional benchmarks via infrastructure enabling performance prediction from much smaller models."},{"attestation":"unclaimed","claim_id":"C4","kind":"headline","source":"verdict.pith_extraction.headline","status":"machine_extracted","text":"GPT-4 reaches human-level scores on professional benchmarks such as a simulated bar exam through scalable training methods."}],"snapshot_sha256":"4fc32b75b846a64b621599b6d1c4703d73e3aadf25954808850356b604779b89"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2303.08774/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"We report the development of GPT-4, a large-scale, multimodal model which can accept image and text inputs and produce text outputs. While less capable than humans in many real-world scenarios, GPT-4 exhibits human-level performance on various professional and academic benchmarks, including passing a simulated bar exam with a score around the top 10% of test takers. GPT-4 is a Transformer-based model pre-trained to predict the next token in a document. The post-training alignment process results in improved performance on measures of factuality and adherence to desired behavior. A core compone","authors_text":"Aalok Mehta, Adam Perelman, Aditya Ramesh, Adrien Ecoffet, Akila Welihinda, Alan Hickey, Alec Radford, Alethea Power, Alex Paino, Alex Passos, Ali Kamali, Alvin Wang, Amin Tootoonchian, Andrea Vallone, Andrew Cann, Andrew Kondrich, Andrew Mayne, Andrew Peng, Andrey Mishchenko, Angela Jiang, Anna-Luisa Brakman, Anna Makanju, Aris Konstantinidis, Arka Dhar, Arun Vijayvergiya, Arvind Neelakantan, Ashley Pantuliano, Ashvin Nair, Atty Eleti, Barret Zoph, Ben Chess, Benjamin Sokolowsky, Ben Wang, Bianca Martin, Billie Jonn, Bob McGrew, Bob Rotsted, Boris Power, Brandon Houghton, Brittany Carey, Brooke Chan, Cameron Raymond, Carl Ross, Carroll Wainwright, Casey Chu, Chak Ming Li, Che Chang, Chelsea Carlson, Chelsea Voss, Chester Cho, Chong Zhang, Chris Hallacy, Chris Hesse, Christian Gibson, Christina Kim, Christine McLeavey, Christopher Berner, CJ Weinmann, Clemens Winter, Cory Decareaux, Cullen O'Keefe, Damien Deville, Daniel Kokotajlo, Daniel Levy, Daniel Mossing, Daniel Selsam, Dave Cummings, Dave Willner, David Dohan, David Farhi, David Medina, David M\\'ely, David Schnurr, Denny Jin, Derek Chen, Diogo Almeida, Elie Georges, Elizabeth Proehl, Elizabeth Tseng, Emy Parparita, Eric Sigler, Evan Morikawa, Felipe Petroski Such, Filipe de Avila Belbute Peres, Florencia Leoni Aleman, Fotis Chantzis, Francis Real, Gabriel Bernadett-Shapiro, Gabriel Goh, Giambattista Parascandolo, Girish Sastry, Greg Brockman, Gretchen Krueger, Haiming Bao, Hannah Wong, Haozhun Jin, Heather Schmidt, Heewoo Jun, Henrique Ponde de Oliveira Pinto, Henri Roussez, Hyeonwoo Noh, Hyung Won Chung, Ian Sohl, Igor Babuschkin, Ikai Lan, Ilge Akkaya, Ilya Sutskever, Ingmar Kanitscheider, Irwan Bello, Isabella Fulford, Jack Rae, Jacob Menick, Jade Leung, Jake Berdine, Jake McNeil, Jakub Pachocki, Jamie Kiros, Jan Hendrik Kirchner, Janko Altenschmidt, Jan Leike, Jason Chen, Jason Wei, Jeff Belgum, Jeff Harris, Jeff Wu, Jeremiah Currier, Jerry Tworek, Jesse Han, Jessica Shieh, Jiayi Weng, Jie Tang, Joanne Jang, Joel Parish, Joe Palermo, Johannes Heidecke, John Schulman, Jonathan Gordon, Jonathan Ward, Jong Wook Kim, Joost Huizinga, Jordan Sitkin, Josh Achiam, Joshua Gross, Juan Felipe Cer\\'on Uribe, Juntang Zhuang, Justin Jay Wang, Juston Forte, Kai Xiao, Katarina Slama, Katie Mayer, Kendra Rimbach, Kenny Hsu, Kevin Button, Kevin Yu, Kim Malfacini, Kyla Sheppard, Kyle Kosic, Lama Ahmad, Lauren Workman, Lenny Bogdonoff, Leo Gao, Liam Fedus, Lilian Weng, Logan Kilpatrick, Long Ouyang, {\\L}ukasz Kaiser, {\\L}ukasz Kondraciuk, Luke Metz, Maddie Simens, Madelaine Boyd, Madeleine B. Thompson, Mario Saltarelli, Mark Chen, Marvin Zhang, Mateusz Litwin, Matt Knight, Matt Wiethoff, Michael Lampe, Michael Petrov, Michael (Rai) Pokorny, Michael Wu, Michelle Pokrass, Mike Heaton, Mikhail Pavlov, Miles Brundage, Mira Murati, Mohammad Bavarian, Molly Lin, Morgan Grafstein, Natalie Staudacher, Natalie Summers, Nick Ryder, Nick Turley, Niko Felix, Nikolas Tezak, Nitish Shirish Keskar, Noah Deutsch, Oleg Boiko, Oleg Murk, OpenAI, Pamela Mishkin, Patricia Lue, Paul Baltescu, Paul McMillan, Peter Hoeschele, Peter Welinder, Phil Tillet, Pranav Shyam, Preston Tuggle, Qiming Yuan, Rachel Lim, Rajeev Nayak, Rapha Gontijo-Lopes, Raul Puri, Red Avila, Reiichiro Nakano, Richard Ngo, Roger Jiang, Rory Carmichael, Rosie Campbell, Rowan Zellers, Ruby Chen, Ryan Greene, Ryan Lowe, Sam Altman, Sam Manning, Samuel Wolrich, Sandhini Agarwal, Sarah Shoker, Sarah Yoo, Scott Gray, Scott Mayer McKinney, Shantanu Jain, Shawn Jain, Sheila Dunning, Shengjia Zhao, Shengli Hu, Sherwin Wu, Shibani Santurkar, Shino Jomoto, Shixiang Shane Gu, Shyamal Anadkat, Sim\\'on Posada Fishman, Stephanie Lin, Steve Dowling, Steven Adler, Suchir Balaji, Sully Chen, Szymon Sidor, Tabarak Khan, Tao Xu, Tarun Gogineni, Teddy Lee, Ted Sanders, Theresa Lopez, Thomas Degry, Tianhao Zheng, Tim Brooks, Todor Markov, Toki Sherbakov, Tolly Powell, Tomer Kaftan, Tong Mu, Trevor Cai, Tyna Eloundou, Valerie Balcom, Vik Goel, Vinnie Monaco, Vishal Kuo, Vitchyr H. Pong, Wade Hickey, William Zhuk, Wojciech Zaremba, Xin Hu, Yang Song, Yaniv Markovski, Yongjik Kim, Yuchen He, Yufei Guo, Yunxing Dai","cross_cats":["cs.AI"],"headline":"GPT-4 reaches human-level scores on professional benchmarks such as a simulated bar exam through scalable training methods.","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report"},"references":{"count":128,"internal_anchors":0,"resolved_work":128,"sample":[{"cited_arxiv_id":"","doi":"","is_internal_anchor":false,"ref_index":1,"title":"Understanding the Capabilities, Limita- tions, and Societal Impact of Large Language Models","work_id":"1689904b-5b09-4173-b2f5-2db66cdb6e35","year":2021},{"cited_arxiv_id":"","doi":"","is_internal_anchor":false,"ref_index":2,"title":"Introducing the new Bing","work_id":"f9b2e988-29db-4d04-a636-5d1f52919c21","year":null},{"cited_arxiv_id":"","doi":"","is_internal_anchor":false,"ref_index":3,"title":"WebGPT: Improving the factual accuracy of language models through web browsing","work_id":"ddff12fd-29cc-4868-beaa-965b68d09703","year":2021},{"cited_arxiv_id":"","doi":"","is_internal_anchor":false,"ref_index":4,"title":"ACT-1: Transformer for Actions – Adept","work_id":"ac6b7be2-5452-4e30-9ea4-13e39eeb8eeb","year":null},{"cited_arxiv_id":"","doi":"","is_internal_anchor":false,"ref_index":5,"title":"Evaluating Large Language Models Trained on Code","work_id":"8dd0b362-ac5a-4739-a79a-039cb586a048","year":2021}],"snapshot_sha256":"2807ebe710808065d36b616e7c6c753a4b40a15fd68bd97342c00a094361d4a4"},"source":{"id":"2303.08774","kind":"arxiv","version":6},"verdict":{"created_at":"2026-05-24T09:45:00.842036Z","id":"9e8e6f7d-00e4-48aa-be5d-c14787c4ed7c","model_set":{"reader":"grok-4.3"},"one_line_summary":"GPT-4 is a scaled Transformer model with post-training alignment that reaches human-level performance on academic and professional benchmarks via infrastructure enabling performance prediction from much smaller models.","pipeline_version":"pith-pipeline@v0.9.0","pith_extraction_headline":"GPT-4 reaches human-level scores on professional benchmarks such as a simulated bar exam through scalable training methods.","strongest_claim":"GPT-4 exhibits human-level performance on various professional and academic benchmarks, including passing a simulated bar exam with a score around the top 10% of test takers.","weakest_assumption":"The reported benchmark scores reflect genuine generalization rather than test contamination, prompt engineering, or post-hoc selection of evaluation conditions (location: abstract, performance claims paragraph)."}},"verdict_id":"9e8e6f7d-00e4-48aa-be5d-c14787c4ed7c"}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:93672c56acee9869a988d00752f38a56e5724d826f114399b473bb3ac3bc87d3","target":"record","created_at":"2026-07-05T07:53:29Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"77a5f47746902cfcda0d758adebcd4d56e76e6eb0c9ed4ed3ae0cee61105914c","cross_cats_sorted":["cs.AI"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2023-03-15T17:15:04Z","title_canon_sha256":"b7c6bfa5b34eb7b67fa8828a4cffa53037421fd4bb13a7901ff93c758a5cc5a3"},"schema_version":"1.0","source":{"id":"2303.08774","kind":"arxiv","version":6}},"canonical_sha256":"15b7376193fea8dbadc302068c39074108da6fbb7700682e9ffba5f6f9e9990b","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"15b7376193fea8dbadc302068c39074108da6fbb7700682e9ffba5f6f9e9990b","first_computed_at":"2026-07-05T07:53:29.835446Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T07:53:29.835446Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"hCcKaukEpS2ST5UcJvNOUl8sNMY7VVlSPaLqwqstGEhQa2R6vxoMjhShEognmgRWFa7rbUt1oC9yswl6K3HEAg==","signature_status":"signed_v1","signed_at":"2026-07-05T07:53:29.835918Z","signed_message":"canonical_sha256_bytes"},"source_id":"2303.08774","source_kind":"arxiv","source_version":6}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:93672c56acee9869a988d00752f38a56e5724d826f114399b473bb3ac3bc87d3","sha256:18dc6f3dc69f7ce7a730fb261cde78fb88ac6135f9a92970e474bbbfc3e9eaef"],"state_sha256":"f520f346e3cea71bc63b5f9d045efeb1d0e224f6a8aac60af9e5823c4d13752a"},"bundle_signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"EsIt68fsTi0ZH1NKVDLF7qeoh08L0nJVnqPMGAQJ0LAEd33/RmCt260HmK+lvXRqsRsJJu0lCicmApOD/31OAQ==","signed_message":"bundle_sha256_bytes","signed_at":"2026-08-04T08:04:20.321360Z","bundle_sha256":"c54114b15a325b57c5e3ec1c15648793f8343ccbdc585b94c7a01e580cefdde5"}}