{"as_of":"2026-08-04T22:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:22b14852b457bf8d881c7f7e9cbd70ad45b2b040bc5eba266865fc97b894b3c1","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T16:54:02.556652Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T11:50:20.718612Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-02T12:16:14.744948Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.10015","last_updated":"2026-04-15T16:59:27Z","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-11T03:58:39Z","title":"FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks","version":2},"cited_work":{"arxiv_id":"2604.10015","doi":"10.48550/arxiv.2604.10015","metadata_source":"pith","pith_arxiv_id":"2604.10015","snapshot_observed_at":"2026-08-02T12:16:14.744948Z","title":"FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks","venue":"cs.AI","work_id":"9386305e-d74c-4119-8064-30b87c41adfb","year":2026},"citing_paper":{"arxiv_id":"2607.20491","last_updated":"2026-07-24T14:53:06Z","snapshot_observed_at":"2026-08-04T19:10:51.320569Z","submitted_at":"2026-06-10T03:31:09Z","title":"DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-02T11:50:20.718612Z"},"links":{"cited_paper":"/paper/2604.10015","citing_paper":"/paper/2607.20491"},"observation_digest":"sha256:844a0f67bde7c7b307c617333b69f58c9ab4fc957e903b9a87df32a65b477a74","observation_id":"56071d13-9f62-4da9-8248-af9d8e5c6bd6","resolution":{"observed_at":"2026-08-02T11:54:15.255546Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.10015/citation-record","integrity":"/paper/2604.10015/integrity","json":"/paper/2604.10015/citation-record.json","paper":"/paper/2604.10015"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Agentpro: Enhancing llm agents with automated process supervision","venue":null,"work_id":"3d4a77ab-7ea6-4b8a-b8d9-4fba921543d9","year":2025},"citing_paper":{"arxiv_id":"2604.10015","last_updated":"2026-04-15T16:59:27Z","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-11T03:58:39Z","title":"FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T16:54:02.556652Z"},"links":{"citing_paper":"/paper/2604.10015"},"observation_digest":"sha256:4f4639ec2d4491b24b1a45f2ae615b58f7ab30352e63dd4b52d38be8ae1e83f3","observation_id":"260fbb84-597f-4bb1-83ed-81e998480ddd","resolution":{"observed_at":"2026-05-17T13:01:47.713243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":"2106.09685","doi":"10.4088/pcc.v03n0609","metadata_source":"pith","pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":"cs.CL","work_id":"0426219a-789e-4964-adc8-a04538510818","year":2021},"citing_paper":{"arxiv_id":"2604.10015","last_updated":"2026-04-15T16:59:27Z","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-11T03:58:39Z","title":"FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T16:54:02.556652Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2604.10015"},"observation_digest":"sha256:939213fb534fdc656278a90b6c8c61ee18a37a2419a24a2134409efdd7c602d8","observation_id":"e4c112c7-39a4-4959-bb7a-d90576cb9100","resolution":{"observed_at":"2026-05-11T07:56:00.229236Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11944","last_updated":"2023-11-20T17:28:02Z","snapshot_observed_at":"2026-07-06T16:50:06.095609Z","submitted_at":"2023-11-20T17:28:02Z","title":"FinanceBench: A New Benchmark for Financial Question Answering","version":1},"cited_work":{"arxiv_id":"2311.11944","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.11944","snapshot_observed_at":"2026-07-04T20:40:08.190653Z","title":"FinanceBench: A New Benchmark for Financial Question Answering","venue":"cs.CL","work_id":"b60d115e-50dd-42f6-9178-5d29b05e1e89","year":2023},"citing_paper":{"arxiv_id":"2604.10015","last_updated":"2026-04-15T16:59:27Z","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-11T03:58:39Z","title":"FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T16:54:02.556652Z"},"links":{"cited_paper":"/paper/2311.11944","citing_paper":"/paper/2604.10015"},"observation_digest":"sha256:2103db860dda59fac84984485d57474a14b1cfd0c1beef78ce137a924a741fc1","observation_id":"ebd6c290-d156-4144-a74d-1f03c421c7d5","resolution":{"observed_at":"2026-05-16T05:01:13.018607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":"2310.06770","doi":"10.1145/512927.512945","metadata_source":"pith","pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","venue":"cs.CL","work_id":"d0effe15-a689-441a-8e3f-ea35f1c4e4b1","year":2023},"citing_paper":{"arxiv_id":"2604.10015","last_updated":"2026-04-15T16:59:27Z","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-11T03:58:39Z","title":"FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T16:54:02.556652Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2604.10015"},"observation_digest":"sha256:7b4fa2ce18243bd4e2e37f36d82570d23e8c85c6b116c7b41e1ab698103cef12","observation_id":"8835f659-29b3-4476-876e-de9178f4025c","resolution":{"observed_at":"2026-05-11T07:56:00.163639Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"URL https://aclanthology.org/2025.sigdial-1.32/","venue":null,"work_id":"40abc8d3-924d-4cf5-9efc-6ee55f8c1bcc","year":2025},"citing_paper":{"arxiv_id":"2604.10015","last_updated":"2026-04-15T16:59:27Z","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-11T03:58:39Z","title":"FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T16:54:02.556652Z"},"links":{"citing_paper":"/paper/2604.10015"},"observation_digest":"sha256:9746e74b9d7424deda720e82e08b3364d7ae5abcdc1d0c88b263e4edbb0331b7","observation_id":"ee3e1edf-a071-439d-bcd1-75dfa5024cbd","resolution":{"observed_at":"2026-05-17T13:01:47.715889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10570","last_updated":"2025-04-30T15:21:51Z","snapshot_observed_at":"2026-07-30T22:06:23.104387Z","submitted_at":"2025-04-30T15:21:51Z","title":"LongFuncEval: Measuring the effectiveness of long context models for function calling","version":1},"cited_work":{"arxiv_id":"2505.10570","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.10570","snapshot_observed_at":"2026-07-04T19:10:05.100242Z","title":"URL https://aclanthology.org/2025.coling-industry.3/","venue":null,"work_id":"a9264ce1-c2f9-4523-9a17-188556edc229","year":2025},"citing_paper":{"arxiv_id":"2604.10015","last_updated":"2026-04-15T16:59:27Z","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-11T03:58:39Z","title":"FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T16:54:02.556652Z"},"links":{"cited_paper":"/paper/2505.10570","citing_paper":"/paper/2604.10015"},"observation_digest":"sha256:febee09fbf2f9716fd94b00e7a7a282a5ddd13ae12f7e2edfb236f7f205873e2","observation_id":"bf1952a5-4c2f-4bad-9013-2157c60342ae","resolution":{"observed_at":"2026-05-11T07:56:00.133797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Api-bank: A comprehensive benchmark for tool-augmented llms","venue":null,"work_id":"8218be52-98a2-40f5-afd7-3ce6ff548b35","year":2023},"citing_paper":{"arxiv_id":"2604.10015","last_updated":"2026-04-15T16:59:27Z","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-11T03:58:39Z","title":"FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T16:54:02.556652Z"},"links":{"citing_paper":"/paper/2604.10015"},"observation_digest":"sha256:c7575b96e52ac87f4d5c8a85d805af790f2a8a4ad8243d80ec8225d42dbae76c","observation_id":"96d334b5-1a43-49d3-8d27-26bd1daaea1d","resolution":{"observed_at":"2026-05-17T13:01:47.710659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.05039","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T23:19:04.025680Z","title":"Findeepforecast: A live multi-agent system for benchmarking deep research agents in financial forecasting.arXiv preprint arXiv:2601.05039","venue":null,"work_id":"e94558f5-6c4b-4603-849b-37939cce4e9e","year":2026},"citing_paper":{"arxiv_id":"2604.10015","last_updated":"2026-04-15T16:59:27Z","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-11T03:58:39Z","title":"FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T16:54:02.556652Z"},"links":{"citing_paper":"/paper/2604.10015"},"observation_digest":"sha256:88e9b450a2cd14d151c1b1494d24d3a11f6f9898eddd79d3296b6d325ae92a44","observation_id":"fc89a28a-8a11-4c57-b0a8-1f4d8f054089","resolution":{"observed_at":"2026-05-11T07:56:00.284676Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-04T04:48:34.061129Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":"2308.03688","doi":"10.1109/fllm63129.2024.10852426","metadata_source":"pith","pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"AgentBench: Evaluating LLMs as Agents","venue":"cs.AI","work_id":"a37549b4-4c94-412d-acc4-4efeb08509be","year":2023},"citing_paper":{"arxiv_id":"2604.10015","last_updated":"2026-04-15T16:59:27Z","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-11T03:58:39Z","title":"FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T16:54:02.556652Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2604.10015"},"observation_digest":"sha256:152e577d4ba2436054ff41a8f8068b0f507d9cadc6e520f1d03612706819682a","observation_id":"6be4d553-fe58-4197-b3c4-3b7ab3f41f4a","resolution":{"observed_at":"2026-05-11T11:40:05.312349Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.08262","last_updated":"2026-08-01T16:26:47Z","snapshot_observed_at":"2026-08-04T22:24:55.789230Z","submitted_at":"2026-03-09T11:33:05Z","title":"FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use","version":2},"cited_work":{"arxiv_id":"2603.08262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.08262","snapshot_observed_at":"2026-08-04T02:24:30.509855Z","title":"FinToolBench: Evaluating LLM agents for real-world financial tool use","venue":null,"work_id":"8522226c-48fc-4572-803d-50d65d29bbee","year":2026},"citing_paper":{"arxiv_id":"2604.10015","last_updated":"2026-04-15T16:59:27Z","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-11T03:58:39Z","title":"FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T16:54:02.556652Z"},"links":{"cited_paper":"/paper/2603.08262","citing_paper":"/paper/2604.10015"},"observation_digest":"sha256:62677b45893bb805c9a39508eec4afcc02ec404f11b16c727d906c0fe5e8f88e","observation_id":"4a191611-72ef-4637-b4c6-2490531d987d","resolution":{"observed_at":"2026-08-04T02:24:30.509855Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.01780","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T20:28:55.459400Z","title":"Mo et al","venue":null,"work_id":"c11cf6cc-103f-4dd4-b614-287868e48e3f","year":2025},"citing_paper":{"arxiv_id":"2604.10015","last_updated":"2026-04-15T16:59:27Z","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-11T03:58:39Z","title":"FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T16:54:02.556652Z"},"links":{"citing_paper":"/paper/2604.10015"},"observation_digest":"sha256:dbf4e781a5514709700975a3f3a7ce196c5e35203d7318bb7669db5c54b8f84d","observation_id":"38a83bc3-3063-4c26-8791-1141063cf9e5","resolution":{"observed_at":"2026-05-11T07:56:00.273124Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16789","last_updated":"2023-10-03T14:45:48Z","snapshot_observed_at":"2026-07-06T16:00:46.542753Z","submitted_at":"2023-07-31T15:56:53Z","title":"ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs","version":2},"cited_work":{"arxiv_id":"2307.16789","doi":"10.48550/arxiv.2307.16789","metadata_source":"pith","pith_arxiv_id":"2307.16789","snapshot_observed_at":"2026-07-10T13:37:06.789691Z","title":"ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs","venue":"cs.AI","work_id":"3c555b48-a4d9-42dd-9fdd-0f6018fbe9cb","year":2023},"citing_paper":{"arxiv_id":"2604.10015","last_updated":"2026-04-15T16:59:27Z","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-11T03:58:39Z","title":"FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T16:54:02.556652Z"},"links":{"cited_paper":"/paper/2307.16789","citing_paper":"/paper/2604.10015"},"observation_digest":"sha256:073b6a9fc518980fdf58ddea5824ee43313ea3acc4d9d9717766f58d39eda7ec","observation_id":"a6dbd9d4-3b38-4bff-9c59-b5101b7448a3","resolution":{"observed_at":"2026-05-11T07:56:00.168307Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:33.730697+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:33.730697+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03439","last_updated":"2025-03-29T13:27:51Z","snapshot_observed_at":"2026-08-02T05:11:07.020968Z","submitted_at":"2024-10-04T13:52:32Z","title":"ToolGen: Unified Tool Retrieval and Calling via Generation","version":3},"cited_work":{"arxiv_id":"2410.03439","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03439","snapshot_observed_at":"2026-07-04T13:39:50.602618Z","title":"Toolgen: Unified tool retrieval and calling via generation","venue":null,"work_id":"6909f198-cead-46c7-9f60-286ef1b54096","year":2024},"citing_paper":{"arxiv_id":"2604.10015","last_updated":"2026-04-15T16:59:27Z","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-11T03:58:39Z","title":"FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T16:54:02.556652Z"},"links":{"cited_paper":"/paper/2410.03439","citing_paper":"/paper/2604.10015"},"observation_digest":"sha256:545bd0e93214227e35eb9a30688206b2a0a5c045ccc791f8ce3776b1245feec2","observation_id":"8461ee18-e8f4-4aa3-8073-351a79d86e96","resolution":{"observed_at":"2026-05-11T07:56:00.303273Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19314","last_updated":"2025-04-18T19:36:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-27T16:47:42Z","title":"LiveBench: A Challenging, Contamination-Limited LLM Benchmark","version":2},"cited_work":{"arxiv_id":"2406.19314","doi":"10.48550/arxiv.2406.19314","metadata_source":"pith","pith_arxiv_id":"2406.19314","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"LiveBench: A Challenging, Contamination-Limited LLM Benchmark","venue":"cs.CL","work_id":"6b2b33bf-350e-4ee2-b8a7-f011e53384e7","year":2024},"citing_paper":{"arxiv_id":"2604.10015","last_updated":"2026-04-15T16:59:27Z","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-11T03:58:39Z","title":"FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T16:54:02.556652Z"},"links":{"cited_paper":"/paper/2406.19314","citing_paper":"/paper/2604.10015"},"observation_digest":"sha256:b6e84c48d706eaef0cd72660adee2212232f0bf6bb22df30a7399f769d11e7e1","observation_id":"c5ef217e-7c33-4b4a-ba8f-63e935a58782","resolution":{"observed_at":"2026-05-15T04:48:26.603034Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14161","last_updated":"2025-09-10T08:35:19Z","snapshot_observed_at":"2026-08-01T16:27:28.241667Z","submitted_at":"2024-12-18T18:55:40Z","title":"TheAgentCompany: Benchmarking LLM Agents on Consequential Real World Tasks","version":3},"cited_work":{"arxiv_id":"2412.14161","doi":"10.48550/arxiv.2412.14161","metadata_source":"pith","pith_arxiv_id":"2412.14161","snapshot_observed_at":"2026-07-11T00:15:00.584486Z","title":"TheAgentCompany: Benchmarking LLM Agents on Consequential Real World Tasks","venue":"cs.CL","work_id":"8ba3cce8-4fc7-4286-9bae-513243ed4e6e","year":2024},"citing_paper":{"arxiv_id":"2604.10015","last_updated":"2026-04-15T16:59:27Z","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-11T03:58:39Z","title":"FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T16:54:02.556652Z"},"links":{"cited_paper":"/paper/2412.14161","citing_paper":"/paper/2604.10015"},"observation_digest":"sha256:707b71cb53cdd908be3e8dc08cf25ac5cf3e51478db93adba04ef9ffdbc0aea8","observation_id":"9d2d87d5-1704-44fb-8600-4bf0b64e7b3c","resolution":{"observed_at":"2026-05-14T22:39:31.128039Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.22862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T10:25:42.155164Z","title":"The evolution of tool use in LLM agents: From single-tool call to multi-tool orchestration","venue":null,"work_id":"a0edaab9-944e-49c1-9eef-78edfbb91f5a","year":2026},"citing_paper":{"arxiv_id":"2604.10015","last_updated":"2026-04-15T16:59:27Z","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-11T03:58:39Z","title":"FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T16:54:02.556652Z"},"links":{"citing_paper":"/paper/2604.10015"},"observation_digest":"sha256:bedfa4d115134872c68833a5cc37b3ffe7b974207ad5a8ed982aa35651e17ba7","observation_id":"51fc605c-66ab-4213-a560-148c7bd38a92","resolution":{"observed_at":"2026-05-11T07:56:00.239263Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16416","last_updated":"2026-04-23T17:36:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-20T17:59:23Z","title":"Survey on Evaluation of LLM-based Agents","version":2},"cited_work":{"arxiv_id":"2503.16416","doi":"10.48550/arxiv.2503.16416","metadata_source":"pith","pith_arxiv_id":"2503.16416","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Survey on Evaluation of LLM-based Agents","venue":"cs.AI","work_id":"d9ac1186-88b1-41bd-9bc7-8a0b87e6f305","year":2025},"citing_paper":{"arxiv_id":"2604.10015","last_updated":"2026-04-15T16:59:27Z","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-11T03:58:39Z","title":"FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T16:54:02.556652Z"},"links":{"cited_paper":"/paper/2503.16416","citing_paper":"/paper/2604.10015"},"observation_digest":"sha256:9888bc96c1a76096c4eea973884cdf8ca39eb9633859a36000615d978ebe6f40","observation_id":"9a1b507f-723e-427c-b929-72e945a0e709","resolution":{"observed_at":"2026-05-11T07:56:00.141516Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T06:20:44.248546+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T06:20:44.248546+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.13936","doi":"10.48550/arxiv.2510.13936","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"A Appendix A.1 Limitations Deep research agents are advancing at a fast pace","venue":null,"work_id":"9bde4280-5ec8-4dd9-b3ab-278581519f6d","year":2025},"citing_paper":{"arxiv_id":"2604.10015","last_updated":"2026-04-15T16:59:27Z","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-11T03:58:39Z","title":"FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T16:54:02.556652Z"},"links":{"citing_paper":"/paper/2604.10015"},"observation_digest":"sha256:5e93fab2819f7429f25e4bc1145ec6644354852c6faa0653f43c76d6ca761ee7","observation_id":"1f856b85-f1a0-4b18-9b63-feb14b45fb16","resolution":{"observed_at":"2026-05-11T07:56:00.290237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.24943","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finmcp-bench: Benchmarking llm agents for real-world financial tool use under the model context protocol.arXiv preprint arXiv:2603.24943","venue":null,"work_id":"e2aa14a7-2ee4-43d5-804d-c5ff23885778","year":null},"citing_paper":{"arxiv_id":"2604.10015","last_updated":"2026-04-15T16:59:27Z","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-11T03:58:39Z","title":"FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T16:54:02.556652Z"},"links":{"citing_paper":"/paper/2604.10015"},"observation_digest":"sha256:5284b86fb1bfe0040bc211c42664f393828b9e0007016fbcdd27f3a69f736600","observation_id":"c24fff9f-11ff-4db7-b7b7-936d60c3fde5","resolution":{"observed_at":"2026-05-11T07:56:00.158751Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Under review","venue":null,"work_id":"4e1a0dbd-e858-4e58-8ed9-0ed8ca095d93","year":2024},"citing_paper":{"arxiv_id":"2604.10015","last_updated":"2026-04-15T16:59:27Z","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-11T03:58:39Z","title":"FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T16:54:02.556652Z"},"links":{"citing_paper":"/paper/2604.10015"},"observation_digest":"sha256:019ce643c32b10be93f6492061ab4d1f42f29e990c4bc881766bdf53b71984a4","observation_id":"6fb9238b-ed82-432c-b347-7670ef70957d","resolution":{"observed_at":"2026-05-17T13:01:47.720840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"More recently, benchmarks have shifted toward evaluating LLM-based agents’ autonomous behavior in complex, interactive envi- ronments","venue":null,"work_id":"2ec96889-a651-47d4-a7e1-d16c8a8e3b39","year":2023},"citing_paper":{"arxiv_id":"2604.10015","last_updated":"2026-04-15T16:59:27Z","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-11T03:58:39Z","title":"FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T16:54:02.556652Z"},"links":{"citing_paper":"/paper/2604.10015"},"observation_digest":"sha256:eefe55fdbca30531160a598e8e912ce9594647e2ab10a929a1093f36db07aac8","observation_id":"297d3393-5398-45d5-a8f2-8557dc74e152","resolution":{"observed_at":"2026-05-17T13:01:47.718506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"{name}:{description}","venue":null,"work_id":"197997c8-65c9-47cf-a7d7-78975824c000","year":2000},"citing_paper":{"arxiv_id":"2604.10015","last_updated":"2026-04-15T16:59:27Z","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-11T03:58:39Z","title":"FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T16:54:02.556652Z"},"links":{"citing_paper":"/paper/2604.10015"},"observation_digest":"sha256:7be51f5e5356f0fc30931ca03ee0602464ff1609579d0b9349198b588495cbd1","observation_id":"5c207545-2383-41f4-b22a-a49d2767868d","resolution":{"observed_at":"2026-05-17T13:01:47.708208Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.10015","last_updated":"2026-04-15T16:59:27Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-11T03:58:39Z","title":"FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":0,"verified_exact":13,"verified_fuzzy":5},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 1 inbound Pith citation observation for arXiv:2604.10015."}