{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:SCIXBECPWDB5VG3ZGI7CIC37FT","short_pith_number":"pith:SCIXBECP","schema_version":"1.0","canonical_sha256":"909170904fb0c3da9b79323e240b7f2ccf606f0d895593201762d749904276f7","source":{"kind":"arxiv","id":"2508.00828","version":1},"attestation_state":"computed","paper":{"title":"Finance Agent Benchmark: Benchmarking LLMs on Real-world Financial Research Tasks","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CE","authors_text":"Antoine Bigeard, Langston Nashold, Rayan Krishnan, Shirley Wu","submitted_at":"2025-05-20T18:22:10Z","abstract_excerpt":"Artificial Intelligence (AI) technology has emerged as a transformative force in financial analysis and the finance industry, though significant questions remain about the full capabilities of Large Language Model (LLM) agents in this domain. We present the Finance Agent Benchmark, featuring challenging and diverse real-world finance research problems that require LLMs to perform complex analysis using recent SEC filings. We construct the benchmark using a taxonomy of nine financial task categories, developed in consultation with experts from banks, hedge funds, and private equity firms. The d"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2508.00828","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CE","submitted_at":"2025-05-20T18:22:10Z","cross_cats_sorted":[],"title_canon_sha256":"db547589324c1f748063f7c40d7ca8220d9a7493b0b328184c3eed0b64f936b2","abstract_canon_sha256":"f1d43381d250d45ac2f446a51cbf45571a80f556f1c99544af49cb763b85cf07"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:47:28.101131Z","signature_b64":"e49hl8Gyqpcli/A5rD6MKZqCo08Mh0l68UM/35jhPj0MPRRGt8xoENz4CrgwvYdNjMtOcABeYxeC+AkOLGRXDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"909170904fb0c3da9b79323e240b7f2ccf606f0d895593201762d749904276f7","last_reissued_at":"2026-07-05T11:47:28.100633Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:47:28.100633Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Finance Agent Benchmark: Benchmarking LLMs on Real-world Financial Research Tasks","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CE","authors_text":"Antoine Bigeard, Langston Nashold, Rayan Krishnan, Shirley Wu","submitted_at":"2025-05-20T18:22:10Z","abstract_excerpt":"Artificial Intelligence (AI) technology has emerged as a transformative force in financial analysis and the finance industry, though significant questions remain about the full capabilities of Large Language Model (LLM) agents in this domain. We present the Finance Agent Benchmark, featuring challenging and diverse real-world finance research problems that require LLMs to perform complex analysis using recent SEC filings. We construct the benchmark using a taxonomy of nine financial task categories, developed in consultation with experts from banks, hedge funds, and private equity firms. The d"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2508.00828","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2508.00828/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2508.00828","created_at":"2026-07-05T11:47:28.100689+00:00"},{"alias_kind":"arxiv_version","alias_value":"2508.00828v1","created_at":"2026-07-05T11:47:28.100689+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2508.00828","created_at":"2026-07-05T11:47:28.100689+00:00"},{"alias_kind":"pith_short_12","alias_value":"SCIXBECPWDB5","created_at":"2026-07-05T11:47:28.100689+00:00"},{"alias_kind":"pith_short_16","alias_value":"SCIXBECPWDB5VG3Z","created_at":"2026-07-05T11:47:28.100689+00:00"},{"alias_kind":"pith_short_8","alias_value":"SCIXBECP","created_at":"2026-07-05T11:47:28.100689+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":21,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.26346","citing_title":"How Do Tool-Augmented LLM Agents Perform on Real-World Energy Analytics Tasks?","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2606.23032","citing_title":"IPO Finance Agent: Benchmark of LLM Financial Analysts Beyond Finance Agent v2, with Automated Rubric Generation, on the SpaceX (SPCX) IPO","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2606.22719","citing_title":"Leakage-Aware Benchmarking of LLM Forecasting: Real-Time Nowcasts as the Decision-Time Input for Macro Factor Ranking","ref_index":41,"is_internal_anchor":false},{"citing_arxiv_id":"2606.13608","citing_title":"AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2606.11166","citing_title":"Flaws in the LLM Automation Narrative","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2606.05661","citing_title":"Continual Learning Bench: Evaluating Frontier AI Systems in Real-World Stateful Environments","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2606.03829","citing_title":"BigFinanceBench: A Workflow-Grounded Benchmark for Financial-Research Agents","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2606.02859","citing_title":"Economy of Minds: Emerging Multi-Agent Intelligence with Economic Interactions","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01886","citing_title":"Absorbing Complexity: An Interaction-Native Knowledge Harness for Financial LLM Agents","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00939","citing_title":"FinCom: A Financial Multi-Agent Demo with Disagree-or-Commit Deliberation","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2605.27466","citing_title":"AgensFlow: A Coordination-Policy Substrate for Multi-Agent Systems","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2606.23032","citing_title":"IPO Finance Agent: Benchmark of LLM Financial Analysts Beyond Finance Agent v2, with Automated Rubric Generation, on the SpaceX (SPCX) IPO","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14355","citing_title":"Herculean: An Agentic Benchmark for Financial Intelligence","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2606.12191","citing_title":"Agentic Environment Engineering for Large Language Models: A Survey of Environment Modeling, Synthesis, Evaluation, and Application","ref_index":161,"is_internal_anchor":false},{"citing_arxiv_id":"2512.13168","citing_title":"Finch: Benchmarking Finance & Accounting across Spreadsheet-Centric Enterprise Workflows","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2604.26235","citing_title":"LATTICE: Evaluating Decision Support Utility of Crypto Agents","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2605.09539","citing_title":"TacoMAS: Test-Time Co-Evolution of Topology and Capability in LLM-based Multi-Agent Systems","ref_index":41,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24668","citing_title":"The Price of Agreement: Measuring LLM Sycophancy in Agentic Financial Applications","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2604.11304","citing_title":"BankerToolBench: Evaluating AI Agents in End-to-End Investment Banking Workflows","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2604.22820","citing_title":"Complete Cyclic Subtask Graphs for Tool-Using LLM Agents: Flexibility, Cost, and Bottlenecks in Multi-Agent Workflows","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17305","citing_title":"BizCompass: Benchmarking the Reasoning Capabilities of LLMs in Business Knowledge and Applications","ref_index":1,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/SCIXBECPWDB5VG3ZGI7CIC37FT","json":"https://pith.science/pith/SCIXBECPWDB5VG3ZGI7CIC37FT.json","graph_json":"https://pith.science/api/pith-number/SCIXBECPWDB5VG3ZGI7CIC37FT/graph.json","events_json":"https://pith.science/api/pith-number/SCIXBECPWDB5VG3ZGI7CIC37FT/events.json","paper":"https://pith.science/paper/SCIXBECP"},"agent_actions":{"view_html":"https://pith.science/pith/SCIXBECPWDB5VG3ZGI7CIC37FT","download_json":"https://pith.science/pith/SCIXBECPWDB5VG3ZGI7CIC37FT.json","view_paper":"https://pith.science/paper/SCIXBECP","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2508.00828&json=true","fetch_graph":"https://pith.science/api/pith-number/SCIXBECPWDB5VG3ZGI7CIC37FT/graph.json","fetch_events":"https://pith.science/api/pith-number/SCIXBECPWDB5VG3ZGI7CIC37FT/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/SCIXBECPWDB5VG3ZGI7CIC37FT/action/timestamp_anchor","attest_storage":"https://pith.science/pith/SCIXBECPWDB5VG3ZGI7CIC37FT/action/storage_attestation","attest_author":"https://pith.science/pith/SCIXBECPWDB5VG3ZGI7CIC37FT/action/author_attestation","sign_citation":"https://pith.science/pith/SCIXBECPWDB5VG3ZGI7CIC37FT/action/citation_signature","submit_replication":"https://pith.science/pith/SCIXBECPWDB5VG3ZGI7CIC37FT/action/replication_record"}},"created_at":"2026-07-05T11:47:28.100689+00:00","updated_at":"2026-07-05T11:47:28.100689+00:00"}