{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:GU32Z4MX56LT56YTMVCSUVI2OD","short_pith_number":"pith:GU32Z4MX","schema_version":"1.0","canonical_sha256":"3537acf197ef973efb1365452a551a70d12d29d17bfac8887419cda3cdde3a09","source":{"kind":"arxiv","id":"2502.15850","version":2},"attestation_state":"computed","paper":{"title":"Forecasting Frontier Language Model Agent Capabilities","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Axel H{\\o}jmark, Govind Pimpale, J\\'er\\'emy Scheurer, Marius Hobbhahn","submitted_at":"2025-02-21T02:34:17Z","abstract_excerpt":"As Language Models (LMs) increasingly operate as autonomous agents, accurately forecasting their capabilities becomes crucial for societal preparedness. We evaluate six forecasting methods that predict downstream capabilities of LM agents. We use \"one-step\" approaches that predict benchmark scores from input metrics like compute or model release date directly or \"two-step\" approaches that first predict an intermediate metric like the principal component of cross-benchmark performance (PC-1) and human-evaluated competitive Elo ratings. We evaluate our forecasting methods by backtesting them on "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.15850","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by-sa/4.0/","primary_cat":"cs.CL","submitted_at":"2025-02-21T02:34:17Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"bafad2f7112f693fd6b6000ae3d7fedbd10fd9a6fee143b5bbc22155ad27eeb1","abstract_canon_sha256":"644cebf62d0c5218f376a0bd4fd16fff3a32ef0feb57c4827acb56a323daddda"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:22:57.492723Z","signature_b64":"nWrAHmTEBt5d8bWVbHuROWx6jV3ZbZgi4MbvdjqzJvSoQmGfVveg5mm/Wj/lhPnstP21JYpMgUwkQ4sM7wGhCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"3537acf197ef973efb1365452a551a70d12d29d17bfac8887419cda3cdde3a09","last_reissued_at":"2026-07-05T10:22:57.491894Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:22:57.491894Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Forecasting Frontier Language Model Agent Capabilities","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Axel H{\\o}jmark, Govind Pimpale, J\\'er\\'emy Scheurer, Marius Hobbhahn","submitted_at":"2025-02-21T02:34:17Z","abstract_excerpt":"As Language Models (LMs) increasingly operate as autonomous agents, accurately forecasting their capabilities becomes crucial for societal preparedness. We evaluate six forecasting methods that predict downstream capabilities of LM agents. We use \"one-step\" approaches that predict benchmark scores from input metrics like compute or model release date directly or \"two-step\" approaches that first predict an intermediate metric like the principal component of cross-benchmark performance (PC-1) and human-evaluated competitive Elo ratings. We evaluate our forecasting methods by backtesting them on "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.15850","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.15850/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.15850","created_at":"2026-07-05T10:22:57.491987+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.15850v2","created_at":"2026-07-05T10:22:57.491987+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.15850","created_at":"2026-07-05T10:22:57.491987+00:00"},{"alias_kind":"pith_short_12","alias_value":"GU32Z4MX56LT","created_at":"2026-07-05T10:22:57.491987+00:00"},{"alias_kind":"pith_short_16","alias_value":"GU32Z4MX56LT56YT","created_at":"2026-07-05T10:22:57.491987+00:00"},{"alias_kind":"pith_short_8","alias_value":"GU32Z4MX","created_at":"2026-07-05T10:22:57.491987+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.08529","citing_title":"Scaffold Effects on GAIA: A Controlled Comparison","ref_index":8,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/GU32Z4MX56LT56YTMVCSUVI2OD","json":"https://pith.science/pith/GU32Z4MX56LT56YTMVCSUVI2OD.json","graph_json":"https://pith.science/api/pith-number/GU32Z4MX56LT56YTMVCSUVI2OD/graph.json","events_json":"https://pith.science/api/pith-number/GU32Z4MX56LT56YTMVCSUVI2OD/events.json","paper":"https://pith.science/paper/GU32Z4MX"},"agent_actions":{"view_html":"https://pith.science/pith/GU32Z4MX56LT56YTMVCSUVI2OD","download_json":"https://pith.science/pith/GU32Z4MX56LT56YTMVCSUVI2OD.json","view_paper":"https://pith.science/paper/GU32Z4MX","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.15850&json=true","fetch_graph":"https://pith.science/api/pith-number/GU32Z4MX56LT56YTMVCSUVI2OD/graph.json","fetch_events":"https://pith.science/api/pith-number/GU32Z4MX56LT56YTMVCSUVI2OD/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/GU32Z4MX56LT56YTMVCSUVI2OD/action/timestamp_anchor","attest_storage":"https://pith.science/pith/GU32Z4MX56LT56YTMVCSUVI2OD/action/storage_attestation","attest_author":"https://pith.science/pith/GU32Z4MX56LT56YTMVCSUVI2OD/action/author_attestation","sign_citation":"https://pith.science/pith/GU32Z4MX56LT56YTMVCSUVI2OD/action/citation_signature","submit_replication":"https://pith.science/pith/GU32Z4MX56LT56YTMVCSUVI2OD/action/replication_record"}},"created_at":"2026-07-05T10:22:57.491987+00:00","updated_at":"2026-07-05T10:22:57.491987+00:00"}