{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2026:7F2O2AZJP66MZTWTKH6U47O6KP","short_pith_number":"pith:7F2O2AZJ","schema_version":"1.0","canonical_sha256":"f974ed03297fbcccced351fd4e7dde53f0c2141245dc23cefc5b3c02ca016acd","source":{"kind":"arxiv","id":"2607.19409","version":1},"attestation_state":"computed","paper":{"title":"FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.AI","authors_text":"Ademola Okerinde, Jeremy Reynolds, Kidus Admassu, Said Bleik, Sarah Panda, Wolfgang M. Pauli","submitted_at":"2026-07-11T01:16:31Z","abstract_excerpt":"Recent advances in large language models have accelerated deployment of agentic systems in operational finance. Existing benchmarks emphasize measuring general capabilities, instruction following, or safety, but few directly address the operational finance workflows that agentic systems are now being deployed to automate. Finance professionals require agents to not only provide factually sound and properly grounded information, but also ensure that this information is verifiable and consistently adheres to rules and constraints of the operational finance domain. We introduce FORCE-Bench, which"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2607.19409","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2026-07-11T01:16:31Z","cross_cats_sorted":[],"title_canon_sha256":"07b7e22c592a5e8bbad58112a764f7938b713ab1c45521b4adfe7020d5f3c311","abstract_canon_sha256":"0088a2e960289837f8277ed13c411f8510e842d35909a11dcabea507d087f892"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-23T00:23:48.611303Z","signature_b64":"7AvYLu6wiZ4z1/3qyECXZIrg6sa5Dst/B+wB2s6RHEpFc5LpoDevEkb7njFysMcGRtPjtchKcPh9LgU4dg2FDg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"f974ed03297fbcccced351fd4e7dde53f0c2141245dc23cefc5b3c02ca016acd","last_reissued_at":"2026-07-23T00:23:48.610418Z","signature_status":"signed_v1","first_computed_at":"2026-07-23T00:23:48.610418Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.AI","authors_text":"Ademola Okerinde, Jeremy Reynolds, Kidus Admassu, Said Bleik, Sarah Panda, Wolfgang M. Pauli","submitted_at":"2026-07-11T01:16:31Z","abstract_excerpt":"Recent advances in large language models have accelerated deployment of agentic systems in operational finance. Existing benchmarks emphasize measuring general capabilities, instruction following, or safety, but few directly address the operational finance workflows that agentic systems are now being deployed to automate. Finance professionals require agents to not only provide factually sound and properly grounded information, but also ensure that this information is verifiable and consistently adheres to rules and constraints of the operational finance domain. We introduce FORCE-Bench, which"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2607.19409","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2607.19409/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2607.19409","created_at":"2026-07-23T00:23:48.610886+00:00"},{"alias_kind":"arxiv_version","alias_value":"2607.19409v1","created_at":"2026-07-23T00:23:48.610886+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2607.19409","created_at":"2026-07-23T00:23:48.610886+00:00"},{"alias_kind":"pith_short_12","alias_value":"7F2O2AZJP66M","created_at":"2026-07-23T00:23:48.610886+00:00"},{"alias_kind":"pith_short_16","alias_value":"7F2O2AZJP66MZTWT","created_at":"2026-07-23T00:23:48.610886+00:00"},{"alias_kind":"pith_short_8","alias_value":"7F2O2AZJ","created_at":"2026-07-23T00:23:48.610886+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/7F2O2AZJP66MZTWTKH6U47O6KP","json":"https://pith.science/pith/7F2O2AZJP66MZTWTKH6U47O6KP.json","graph_json":"https://pith.science/api/pith-number/7F2O2AZJP66MZTWTKH6U47O6KP/graph.json","events_json":"https://pith.science/api/pith-number/7F2O2AZJP66MZTWTKH6U47O6KP/events.json","paper":"https://pith.science/paper/7F2O2AZJ"},"agent_actions":{"view_html":"https://pith.science/pith/7F2O2AZJP66MZTWTKH6U47O6KP","download_json":"https://pith.science/pith/7F2O2AZJP66MZTWTKH6U47O6KP.json","view_paper":"https://pith.science/paper/7F2O2AZJ","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2607.19409&json=true","fetch_graph":"https://pith.science/api/pith-number/7F2O2AZJP66MZTWTKH6U47O6KP/graph.json","fetch_events":"https://pith.science/api/pith-number/7F2O2AZJP66MZTWTKH6U47O6KP/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/7F2O2AZJP66MZTWTKH6U47O6KP/action/timestamp_anchor","attest_storage":"https://pith.science/pith/7F2O2AZJP66MZTWTKH6U47O6KP/action/storage_attestation","attest_author":"https://pith.science/pith/7F2O2AZJP66MZTWTKH6U47O6KP/action/author_attestation","sign_citation":"https://pith.science/pith/7F2O2AZJP66MZTWTKH6U47O6KP/action/citation_signature","submit_replication":"https://pith.science/pith/7F2O2AZJP66MZTWTKH6U47O6KP/action/replication_record"}},"created_at":"2026-07-23T00:23:48.610886+00:00","updated_at":"2026-07-23T00:23:48.610886+00:00"}