{"as_of":"2026-08-06T12:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ac6d3697e83dfadd3f732c96bc8755ea9cf564955e9f925b521cedbb7cd290e4","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T05:54:53.457765Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T19:18:04.072730Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T19:22:44.995647Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"cited_work":{"arxiv_id":"2603.08262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.08262","snapshot_observed_at":"2026-08-04T02:24:30.509855Z","title":"FinToolBench: Evaluating LLM agents for real-world financial tool use","venue":null,"work_id":"8522226c-48fc-4572-803d-50d65d29bbee","year":2026},"citing_paper":{"arxiv_id":"2604.10015","last_updated":"2026-04-15T16:59:27Z","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-11T03:58:39Z","title":"FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T16:54:02.556652Z"},"links":{"cited_paper":"/paper/2603.08262","citing_paper":"/paper/2604.10015"},"observation_digest":"sha256:f1401cc3708ccb2e6b1751e7350c239c5812c2642d5baeea337bfb9765c0e6e7","observation_id":"4a191611-72ef-4637-b4c6-2490531d987d","resolution":{"observed_at":"2026-08-04T02:24:30.509855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"cited_work":{"arxiv_id":"2603.08262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.08262","snapshot_observed_at":"2026-08-04T02:24:30.509855Z","title":"FinToolBench: Evaluating LLM agents for real-world financial tool use","venue":null,"work_id":"8522226c-48fc-4572-803d-50d65d29bbee","year":2026},"citing_paper":{"arxiv_id":"2605.16895","last_updated":"2026-05-16T09:14:35Z","snapshot_observed_at":"2026-07-06T23:27:57.805018Z","submitted_at":"2026-05-16T09:14:35Z","title":"The Alpha Illusion: Reported Alpha from LLM Trading Agents Should Not Be Treated as Deployment Evidence","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T19:18:04.072730Z"},"links":{"cited_paper":"/paper/2603.08262","citing_paper":"/paper/2605.16895"},"observation_digest":"sha256:0ddc9cbed97d6c51c40f8bf79d5e115c237f0e3a4789097b98f87bc58a4e1666","observation_id":"6d07b74d-89ed-4c4c-87a8-c44d5875b606","resolution":{"observed_at":"2026-08-04T02:24:30.509855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2603.08262/citation-record","integrity":"/paper/2603.08262/integrity","json":"/paper/2603.08262/citation-record.json","paper":"/paper/2603.08262"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07982","last_updated":"2025-06-09T17:52:18Z","snapshot_observed_at":"2026-07-06T21:39:13.304260Z","submitted_at":"2025-06-09T17:52:18Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07982","snapshot_observed_at":"2026-08-04T05:54:53.343959Z","title":"2025.𝜏 2-bench: Evaluating conversational agents in a dual-control environment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.343959Z"},"links":{"cited_paper":"/paper/2506.07982","citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:50bed0f45c1ea5177ba1c04ce804ea5834a1115e5f6c29f48624ddb677522d91","observation_id":"859acbed-2509-451b-9be9-ba93822d6691","resolution":{"observed_at":"2026-08-04T05:54:53.343959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00828","last_updated":"2025-05-20T18:22:10Z","snapshot_observed_at":"2026-07-06T22:06:29.893344Z","submitted_at":"2025-05-20T18:22:10Z","title":"Finance Agent Benchmark: Benchmarking LLMs on Real-world Financial Research Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.00828","snapshot_observed_at":"2026-08-04T05:54:53.348743Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.348743Z"},"links":{"cited_paper":"/paper/2508.00828","citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:083faa7f939ba572d827edd024a14b76e31c66a05f92a77499064b385896906f","observation_id":"9884bc28-e204-49d0-b0b1-909bc64e538c","resolution":{"observed_at":"2026-08-04T05:54:53.348743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03216","last_updated":"2025-12-12T11:26:32Z","snapshot_observed_at":"2026-07-06T17:25:35.493362Z","submitted_at":"2024-02-05T17:26:49Z","title":"M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03216","snapshot_observed_at":"2026-08-04T05:54:53.352174Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.352174Z"},"links":{"cited_paper":"/paper/2402.03216","citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:523c155b7b67314bbff10f3de51a6558c36a9d90faf07047d6b2c7b0d579b07f","observation_id":"dbe4cad3-e58e-4a74-b236-6f7128ee629f","resolution":{"observed_at":"2026-08-04T05:54:53.352174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:54:53.355821Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.355821Z"},"links":{"citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:71f7d83a1a25a8fed837bf94fc9d6fc98bdb7a1b73a869835ea9a495ddc05a12","observation_id":"d8206850-8f48-43a1-9c3a-86563a56fe36","resolution":{"observed_at":"2026-08-04T05:54:53.355821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07718","last_updated":"2024-07-23T06:19:28Z","snapshot_observed_at":"2026-08-02T12:09:24.340284Z","submitted_at":"2024-03-12T14:58:45Z","title":"WorkArena: How Capable Are Web Agents at Solving Common Knowledge Work Tasks?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07718","snapshot_observed_at":"2026-08-04T05:54:53.358907Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.358907Z"},"links":{"cited_paper":"/paper/2403.07718","citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:7ef872db05c4555198306abfabf67d1c14751f8e5f04b605b514ca7bdb1273ed","observation_id":"af2f8aec-c579-4279-8b47-8c2b267aace7","resolution":{"observed_at":"2026-08-04T05:54:53.358907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:54:53.362401Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.362401Z"},"links":{"citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:85c7761e29dce04928323740b45583b16a3eb755aea8fa059205d4179f2b5fd4","observation_id":"1eb031f6-8c43-4f97-930a-37cab0e25cd6","resolution":{"observed_at":"2026-08-04T05:54:53.362401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06211","last_updated":"2025-01-03T09:17:23Z","snapshot_observed_at":"2026-08-04T22:38:55.335436Z","submitted_at":"2025-01-03T09:17:23Z","title":"FLAME: Financial Large-Language Model Assessment and Metrics Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06211","snapshot_observed_at":"2026-08-04T05:54:53.365656Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.365656Z"},"links":{"cited_paper":"/paper/2501.06211","citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:706d3b3a1ccccb4ccdda142b6c12926e4f68d1670b692c25890e5996edc0e56e","observation_id":"e6f47a16-ab18-4ab7-886b-0a3393d8ec0a","resolution":{"observed_at":"2026-08-04T05:54:53.365656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:54:53.369024Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.369024Z"},"links":{"citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:292781628827f920c7199a0b8a184c4bd7be09c48136cafa490dc349f0e42a69","observation_id":"30c32a3c-b80a-4623-a5c4-3d103cefc236","resolution":{"observed_at":"2026-08-04T05:54:53.369024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07714","last_updated":"2025-03-05T07:39:03Z","snapshot_observed_at":"2026-08-05T00:50:54.678872Z","submitted_at":"2024-03-12T14:57:40Z","title":"StableToolBench: Towards Stable Large-Scale Benchmarking on Tool Learning of Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07714","snapshot_observed_at":"2026-08-04T05:54:53.374955Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.374955Z"},"links":{"cited_paper":"/paper/2403.07714","citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:6b5c8aa29958132c2e93b10c761b01acf5ab37d952ac59ff1fff94fc489d2ea0","observation_id":"4aed8ea9-6fbe-410c-a594-fb98dc41faad","resolution":{"observed_at":"2026-08-04T05:54:53.374955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:54:53.378132Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.378132Z"},"links":{"citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:e6504c1396fd354d99735b8ca6c7456e0e4a72a633db704eb6d1620fb9ef3c7c","observation_id":"4ab99314-945a-4689-9156-cb28308ad84c","resolution":{"observed_at":"2026-08-04T05:54:53.378132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:54:53.381167Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.381167Z"},"links":{"citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:add4404d5f3dc582114db9ec4ede3194ba3f3c0884825afcf5576732d1b7bd7c","observation_id":"86941933-c336-44a5-aad9-781cd78b340b","resolution":{"observed_at":"2026-08-04T05:54:53.381167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11944","last_updated":"2023-11-20T17:28:02Z","snapshot_observed_at":"2026-07-06T16:50:06.095609Z","submitted_at":"2023-11-20T17:28:02Z","title":"FinanceBench: A New Benchmark for Financial Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11944","snapshot_observed_at":"2026-08-04T05:54:53.384134Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.384134Z"},"links":{"cited_paper":"/paper/2311.11944","citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:7174fff812efabec3e9dba2882337e9032a347765ab05ab28a9345949903fa9e","observation_id":"4d67e698-2939-4f02-98ed-82e77881dd1e","resolution":{"observed_at":"2026-08-04T05:54:53.384134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:54:53.387329Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.387329Z"},"links":{"citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:e1cdb24e7e12f32342d4ab93afafd4247e01e83d80f8a5fe6094a7123fe4f751","observation_id":"cf4bf12f-6b8a-497d-a4f6-27539ddc38f7","resolution":{"observed_at":"2026-08-04T05:54:53.387329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08244","last_updated":"2023-10-25T06:54:12Z","snapshot_observed_at":"2026-08-02T00:07:12.855748Z","submitted_at":"2023-04-14T14:05:32Z","title":"API-Bank: A Comprehensive Benchmark for Tool-Augmented LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08244","snapshot_observed_at":"2026-08-04T05:54:53.390032Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.390032Z"},"links":{"cited_paper":"/paper/2304.08244","citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:f8d9df3bc8253d881d0dc2a37b0d0d78fae22819b2c00d87a49a229fd21a5962","observation_id":"f50ff977-8629-4a1f-a475-43247594d8a6","resolution":{"observed_at":"2026-08-04T05:54:53.390032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-04T04:48:34.061129Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-04T05:54:53.393046Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.393046Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:f0ce7e78ceb6ec6ab4875c7e70982f3f10ab6373d96cbd500ae25efb7a5c64ac","observation_id":"e57bcd3d-7d72-4209-8845-8d402f9e99e5","resolution":{"observed_at":"2026-08-04T05:54:53.393046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16634","last_updated":"2023-05-23T22:12:16Z","snapshot_observed_at":"2026-08-02T04:02:36.848064Z","submitted_at":"2023-03-29T12:46:54Z","title":"G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16634","snapshot_observed_at":"2026-08-04T05:54:53.396131Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.396131Z"},"links":{"cited_paper":"/paper/2303.16634","citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:386f04a078a472c2d36cd4c8d2a9482bdae45f196893070c17e22c26d71a085a","observation_id":"a278a5f3-041b-4b89-b9cb-f96aa7f0eeab","resolution":{"observed_at":"2026-08-04T05:54:53.396131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:54:53.399233Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.399233Z"},"links":{"citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:9945f196400e77bbb860b4577547140ba9bd304dea62dbd1211d6b604f6310d3","observation_id":"806f1462-b4bc-4bd4-95fd-087e9bae6439","resolution":{"observed_at":"2026-08-04T05:54:53.399233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12983","last_updated":"2023-11-21T20:34:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-21T20:34:47Z","title":"GAIA: a benchmark for General AI Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12983","snapshot_observed_at":"2026-08-04T05:54:53.401977Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.401977Z"},"links":{"cited_paper":"/paper/2311.12983","citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:83734b150e12a2869c1a954b8a422acb7ff1ebbb056774034458437e497d0819","observation_id":"96cb0f78-76d6-4eb7-9ef9-dfbd5e2e7634","resolution":{"observed_at":"2026-08-04T05:54:53.401977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:54:53.405316Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.405316Z"},"links":{"citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:96eaab13b8c7672d9835f25529c9865ca188285f71071f1165ae9272a6056f09","observation_id":"febe7703-8991-459b-a502-7145a43176d8","resolution":{"observed_at":"2026-08-04T05:54:53.405316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:54:53.408131Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.408131Z"},"links":{"citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:c88b7ea4f217804b39fc8644bc6463dd96e4e01164df750b085856d0f7e2924b","observation_id":"a7468b0a-0595-47bd-971c-021bd864e354","resolution":{"observed_at":"2026-08-04T05:54:53.408131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:54:53.411111Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.411111Z"},"links":{"citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:9d2f1aece22fabccc66e55fe7a17cc0909b8f6e14d6e376b734f80dce290a532","observation_id":"2e057fd1-19a5-4747-af36-ac67b61988b9","resolution":{"observed_at":"2026-08-04T05:54:53.411111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16789","last_updated":"2023-10-03T14:45:48Z","snapshot_observed_at":"2026-07-06T16:00:46.542753Z","submitted_at":"2023-07-31T15:56:53Z","title":"ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16789","snapshot_observed_at":"2026-08-04T05:54:53.413919Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.413919Z"},"links":{"cited_paper":"/paper/2307.16789","citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:e69f473f5366cccc2ab2e9343a64b896fc72adeddc8f011271cf542b29ca6f85","observation_id":"25a74c1b-360c-44b6-a910-301a0d1c813c","resolution":{"observed_at":"2026-08-04T05:54:53.413919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:54:53.417127Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.417127Z"},"links":{"citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:dbc722cc19654a67f18b773739738cc0bb9a955d8a98fc5ad51f948367a73352","observation_id":"1e2e1e30-4536-4616-b3c5-1c56e6ee202a","resolution":{"observed_at":"2026-08-04T05:54:53.417127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04957","last_updated":"2025-03-06T20:43:14Z","snapshot_observed_at":"2026-07-06T20:48:13.849680Z","submitted_at":"2025-03-06T20:43:14Z","title":"SafeArena: Evaluating the Safety of Autonomous Web Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04957","snapshot_observed_at":"2026-08-04T05:54:53.420052Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.420052Z"},"links":{"cited_paper":"/paper/2503.04957","citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:67f5ae689b5b60b0c5d7a002ed1df55d8a2804674afcd1cc8d10894456ac7cf1","observation_id":"6c2131e6-bb1d-46e1-bc57-b5da995e2d0e","resolution":{"observed_at":"2026-08-04T05:54:53.420052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:54:53.423254Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.423254Z"},"links":{"citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:d0d1e75ded3f7e511a5bddcbae06019ac16d648f9aafae32ed981b6856efc471","observation_id":"679b38e7-7ec5-4721-9c9e-c9e159f555ad","resolution":{"observed_at":"2026-08-04T05:54:53.423254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.07315","last_updated":"2025-09-09T01:31:25Z","snapshot_observed_at":"2026-08-04T22:30:33.163371Z","submitted_at":"2025-09-09T01:31:25Z","title":"SafeToolBench: Pioneering a Prospective Benchmark to Evaluating Tool Utilization Safety in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.07315","snapshot_observed_at":"2026-08-04T05:54:53.426020Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.426020Z"},"links":{"cited_paper":"/paper/2509.07315","citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:a7e64ea1d5085744e5a0a622893ebe463fa80dd09fd4b26581d6049c3922b1de","observation_id":"26540f43-af16-4e7e-bb42-cb33189006f4","resolution":{"observed_at":"2026-08-04T05:54:53.426020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:54:53.429305Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.429305Z"},"links":{"citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:f250b071a7471b0e30d7c5dc7bed6115470930584d49a8a3a83fa7512398ddf6","observation_id":"89d8f2f1-fe35-4ee6-a158-25e4d1a90e27","resolution":{"observed_at":"2026-08-04T05:54:53.429305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-02T22:19:29.043854Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-08-04T05:54:53.432087Z","title":"2024.𝜏- bench: A benchmark for tool-agent-user interaction in real-world domains.arXiv preprint arXiv:2406.12045(2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.432087Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:b46d07cccaa3f7dbb0e5e0bfbcb9fb4461a1caaf54e3a37173d090989fbfcc5e","observation_id":"0eda073c-d7bf-42d9-8df5-a4b478312926","resolution":{"observed_at":"2026-08-04T05:54:53.432087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-04T05:54:53.435298Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.435298Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:364e0975aba70fa58b7e14748c0a44dedd4c2ca485e2b3b7c2b9fdad85bf54a0","observation_id":"b8990477-510d-46f1-b607-dc9afe71188a","resolution":{"observed_at":"2026-08-04T05:54:53.435298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12501","last_updated":"2025-04-07T05:22:27Z","snapshot_observed_at":"2026-07-06T20:38:20.545914Z","submitted_at":"2025-02-18T03:31:06Z","title":"Crowd Comparative Reasoning: Unlocking Comprehensive Evaluations for LLM-as-a-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12501","snapshot_observed_at":"2026-08-04T05:54:53.438494Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.438494Z"},"links":{"cited_paper":"/paper/2502.12501","citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:bb8bf413de623dcabc6db56fdc29c7703c0320bc82bec8a4f9c305d34210ecf8","observation_id":"45e29297-f2e1-43a1-ad3d-50051d70b1c3","resolution":{"observed_at":"2026-08-04T05:54:53.438494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-04T05:54:53.441547Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.441547Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:f0270eefabffd63e32f7d84b1bedf6e6b17cddc342236dab38d1d87380410752","observation_id":"5064c39e-4149-440d-ae01-72fc7c1b281c","resolution":{"observed_at":"2026-08-04T05:54:53.441547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13854","last_updated":"2024-04-16T15:13:18Z","snapshot_observed_at":"2026-07-06T15:58:31.756298Z","submitted_at":"2023-07-25T22:59:32Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13854","snapshot_observed_at":"2026-08-04T05:54:53.444622Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.444622Z"},"links":{"cited_paper":"/paper/2307.13854","citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:77e23e1f48f660ad01c02f11420cc200524cbff86e2a63ddd0d10310c673340f","observation_id":"d2b15ff7-1928-449a-9eab-c290f54dd613","resolution":{"observed_at":"2026-08-04T05:54:53.444622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.07624","last_updated":"2021-06-01T05:38:50Z","snapshot_observed_at":"2026-07-06T11:09:57.732606Z","submitted_at":"2021-05-17T06:12:06Z","title":"TAT-QA: A Question Answering Benchmark on a Hybrid of Tabular and Textual Content in Finance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.07624","snapshot_observed_at":"2026-08-04T05:54:53.447880Z","title":"question requirement","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.447880Z"},"links":{"cited_paper":"/paper/2105.07624","citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:f667a296cfc667e6539f4891e45109858121685d0bcca03e7edbd343436a08db","observation_id":"07adea44-7498-45da-8c33-5ec3a94e62df","resolution":{"observed_at":"2026-08-04T05:54:53.447880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:54:53.451591Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.451591Z"},"links":{"citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:02aab9b195aca18f9df0fc970afb6bbe3e709d58a65300679f4ebfc7891c75ce","observation_id":"70815969-94d0-4203-ad84-0bfc277bf569","resolution":{"observed_at":"2026-08-04T05:54:53.451591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:54:53.454737Z","title":"<RAPIDAPI_KEY>","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.454737Z"},"links":{"citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:af88498b4debf54b0adc655075abeba4b6aa6abd105914f77d5c0fd1d35fdfdb","observation_id":"df0b3f31-db4b-495f-949e-b10f63b28453","resolution":{"observed_at":"2026-08-04T05:54:53.454737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:54:53.457765Z","title":"Performance is not measured through operating margin","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.457765Z"},"links":{"citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:e6a858b9979f0e0bfea12c4ad6289374ff07b707ea03ee37609d567d2ca51ad4","observation_id":"453808de-f19d-417d-86d8-b0bbd7710918","resolution":{"observed_at":"2026-08-04T05:54:53.457765Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T05:54:53.372052Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T05:54:53.372052Z"},"links":{"citing_paper":"/paper/2603.08262"},"observation_digest":"sha256:a44e10e5b5fc6f2b35113de5f851d1a0df9519e9bb89aa079ff3add0db7e624f","observation_id":"d33d8473-7a38-4cb4-8acf-d62e6fcdeeeb","resolution":{"observed_at":"2026-08-04T05:54:53.372052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T12:09:54.747725Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 2 inbound Pith citation observations for arXiv:2603.08262."}