{"as_of":"2026-08-09T12:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:52902a3dfc87bb23839638576e68915129b88831d51913c0adfe7fb4407094f8","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T11:50:22.254315Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.20491/citation-record","integrity":"/paper/2607.20491/integrity","json":"/paper/2607.20491/citation-record.json","paper":"/paper/2607.20491"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.14516","last_updated":"2026-06-12T14:47:37Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T14:47:37Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","version":1},"cited_work":{"arxiv_id":"2606.14516","doi":"10.48550/arxiv.2606.14516","metadata_source":"pith","pith_arxiv_id":"2606.14516","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results","venue":"cs.AI","work_id":"24b62377-760d-4dcb-8e31-3ee3c7866481","year":2026},"citing_paper":{"arxiv_id":"2607.20491","last_updated":"2026-07-24T14:53:06Z","snapshot_observed_at":"2026-08-06T04:10:40.538060Z","submitted_at":"2026-06-10T03:31:09Z","title":"DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-02T11:50:20.579924Z"},"links":{"cited_paper":"/paper/2606.14516","citing_paper":"/paper/2607.20491"},"observation_digest":"sha256:3d510b89ca48dc2a5ce99fa2ef93946e8ecf27ac45887c7184bd6c9d6313bf95","observation_id":"42904533-c7aa-4ee7-9909-53bf29b36b24","resolution":{"observed_at":"2026-08-02T11:54:15.471726Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:50:20.651970Z","title":"Revised guidance on model risk management: Supervisory letter SR 26-2","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20491","last_updated":"2026-07-24T14:53:06Z","snapshot_observed_at":"2026-08-06T04:10:40.538060Z","submitted_at":"2026-06-10T03:31:09Z","title":"DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-02T11:50:20.651970Z"},"links":{"citing_paper":"/paper/2607.20491"},"observation_digest":"sha256:67d240d95193b2498433f653f4fd877134ed0d8ae91609911b17f670b09045f2","observation_id":"c66a9a79-0f12-4358-a7dd-6ab01e355df9","resolution":{"observed_at":"2026-08-02T11:50:20.651970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10015","last_updated":"2026-04-15T16:59:27Z","snapshot_observed_at":"2026-07-06T22:58:43.155246Z","submitted_at":"2026-04-11T03:58:39Z","title":"FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks","version":2},"cited_work":{"arxiv_id":"2604.10015","doi":"10.48550/arxiv.2604.10015","metadata_source":"pith","pith_arxiv_id":"2604.10015","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks","venue":"cs.AI","work_id":"9386305e-d74c-4119-8064-30b87c41adfb","year":2026},"citing_paper":{"arxiv_id":"2607.20491","last_updated":"2026-07-24T14:53:06Z","snapshot_observed_at":"2026-08-06T04:10:40.538060Z","submitted_at":"2026-06-10T03:31:09Z","title":"DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-02T11:50:20.718612Z"},"links":{"cited_paper":"/paper/2604.10015","citing_paper":"/paper/2607.20491"},"observation_digest":"sha256:13ea14b2dbed78cb0f7982d02a0ee455201fa5976f61c6ababffeaf2009bec29","observation_id":"56071d13-9f62-4da9-8248-af9d8e5c6bd6","resolution":{"observed_at":"2026-08-02T11:54:15.255546Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:50:20.817091Z","title":"Visibility into AI agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20491","last_updated":"2026-07-24T14:53:06Z","snapshot_observed_at":"2026-08-06T04:10:40.538060Z","submitted_at":"2026-06-10T03:31:09Z","title":"DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-02T11:50:20.817091Z"},"links":{"citing_paper":"/paper/2607.20491"},"observation_digest":"sha256:817edbc9ef2ca3b01a43a02d12c236e3ba7b15e681355c0df4b46a2527bda510","observation_id":"da51d50a-1d4f-46b1-9cc1-766d597f3eec","resolution":{"observed_at":"2026-08-02T11:50:20.817091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:50:21.037586Z","title":"TRAJECT-Bench : A trajectory-aware benchmark for evaluating agentic tool use","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20491","last_updated":"2026-07-24T14:53:06Z","snapshot_observed_at":"2026-08-06T04:10:40.538060Z","submitted_at":"2026-06-10T03:31:09Z","title":"DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-02T11:50:21.037586Z"},"links":{"citing_paper":"/paper/2607.20491"},"observation_digest":"sha256:2ec148c962867ae8081c86ae30bc6fd2d5f70f1f0e9c88e2ba368238f72ff720","observation_id":"9daec3ae-59d2-4c63-a3bf-57d214f3a59c","resolution":{"observed_at":"2026-08-02T11:50:21.037586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:50:21.144230Z","title":"AI safety best practices for regulated environments","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20491","last_updated":"2026-07-24T14:53:06Z","snapshot_observed_at":"2026-08-06T04:10:40.538060Z","submitted_at":"2026-06-10T03:31:09Z","title":"DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-02T11:50:21.144230Z"},"links":{"citing_paper":"/paper/2607.20491"},"observation_digest":"sha256:30dea951c426ecc35335d6da466d09fab7b1361a6259a35c202e6ba4d50e6223","observation_id":"8d78d997-5196-4dfa-932d-77e7a44461ad","resolution":{"observed_at":"2026-08-02T11:50:21.144230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:50:21.216412Z","title":"A review of evaluation metrics for text similarity","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20491","last_updated":"2026-07-24T14:53:06Z","snapshot_observed_at":"2026-08-06T04:10:40.538060Z","submitted_at":"2026-06-10T03:31:09Z","title":"DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-02T11:50:21.216412Z"},"links":{"citing_paper":"/paper/2607.20491"},"observation_digest":"sha256:26e9dc8ded2c807028bfacfc8f6e881b5264ea705739f0718d4962083254ff17","observation_id":"7be5c78c-c390-4332-bb34-795808e262a4","resolution":{"observed_at":"2026-08-02T11:50:21.216412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:50:21.298577Z","title":"ToolSandbox : A stateful, conversational, interactive evaluation benchmark for LLM tool use capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20491","last_updated":"2026-07-24T14:53:06Z","snapshot_observed_at":"2026-08-06T04:10:40.538060Z","submitted_at":"2026-06-10T03:31:09Z","title":"DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-02T11:50:21.298577Z"},"links":{"citing_paper":"/paper/2607.20491"},"observation_digest":"sha256:24b9d254eb3df2944bb5a566434aab1f5316a1d8d1b78e05c73fa0ab77e17b27","observation_id":"92138f80-1996-4ac2-a18e-59d2d09a959f","resolution":{"observed_at":"2026-08-02T11:50:21.298577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07795","last_updated":"2026-05-30T17:04:27Z","snapshot_observed_at":"2026-08-08T10:56:08.402825Z","submitted_at":"2025-12-08T18:26:58Z","title":"ReasonBENCH: Benchmarking the (In)Stability of LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.07795","snapshot_observed_at":"2026-08-02T11:50:21.375965Z","title":"ReasonBENCH : Benchmarking the (in)stability of LLM reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20491","last_updated":"2026-07-24T14:53:06Z","snapshot_observed_at":"2026-08-06T04:10:40.538060Z","submitted_at":"2026-06-10T03:31:09Z","title":"DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-02T11:50:21.375965Z"},"links":{"cited_paper":"/paper/2512.07795","citing_paper":"/paper/2607.20491"},"observation_digest":"sha256:5c855bd5b78b3db666f015efbc357bee0a447988e90b60a0384e5f719ab14ec1","observation_id":"75723614-9fc7-4260-b0ba-3067f4de8771","resolution":{"observed_at":"2026-08-02T11:50:21.375965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:50:21.492854Z","title":"FinResearchBench : A logic tree based agent-as-a-judge evaluation framework for financial research agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20491","last_updated":"2026-07-24T14:53:06Z","snapshot_observed_at":"2026-08-06T04:10:40.538060Z","submitted_at":"2026-06-10T03:31:09Z","title":"DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-02T11:50:21.492854Z"},"links":{"citing_paper":"/paper/2607.20491"},"observation_digest":"sha256:b173402b22246c4186bf8dad2bd440a4cc67b2f7ea280c007c84c5b272896315","observation_id":"b0aabff8-f433-4208-923d-50d55c5a64c4","resolution":{"observed_at":"2026-08-02T11:50:21.492854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:50:21.661266Z","title":"Scalable runtime governance for agentic AI in financial services","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20491","last_updated":"2026-07-24T14:53:06Z","snapshot_observed_at":"2026-08-06T04:10:40.538060Z","submitted_at":"2026-06-10T03:31:09Z","title":"DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-02T11:50:21.661266Z"},"links":{"citing_paper":"/paper/2607.20491"},"observation_digest":"sha256:c0d299cc9009e26532e15e9a086876c765c2904a1e08dc2d8dc934d6988d1f26","observation_id":"bcd03b1b-b4ae-455b-a469-d68db2085fd6","resolution":{"observed_at":"2026-08-02T11:50:21.661266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16974","last_updated":"2025-09-13T01:57:49Z","snapshot_observed_at":"2026-08-07T16:47:06.262521Z","submitted_at":"2025-03-21T09:43:37Z","title":"Assessing Consistency and Reproducibility in the Outputs of Large Language Models: Evidence Across Diverse Finance and Accounting Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16974","snapshot_observed_at":"2026-08-02T11:50:21.831933Z","title":"Assessing consistency and reproducibility in the outputs of large language models: Evidence across diverse finance and accounting tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20491","last_updated":"2026-07-24T14:53:06Z","snapshot_observed_at":"2026-08-06T04:10:40.538060Z","submitted_at":"2026-06-10T03:31:09Z","title":"DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-02T11:50:21.831933Z"},"links":{"cited_paper":"/paper/2503.16974","citing_paper":"/paper/2607.20491"},"observation_digest":"sha256:07832362ddc11dec436ea4e7beaf82a290442d7d77877c5fec985c8faba33a61","observation_id":"d781a69a-bd23-4d97-b24f-630a92ca4bd9","resolution":{"observed_at":"2026-08-02T11:50:21.831933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:50:21.988653Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20491","last_updated":"2026-07-24T14:53:06Z","snapshot_observed_at":"2026-08-06T04:10:40.538060Z","submitted_at":"2026-06-10T03:31:09Z","title":"DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-02T11:50:21.988653Z"},"links":{"citing_paper":"/paper/2607.20491"},"observation_digest":"sha256:006108b662e88b98775204b2b601af61a4cdaa212b51878b7ef7bf368e77ce0d","observation_id":"a8be4c58-d500-4765-9c72-9840ce4f7a08","resolution":{"observed_at":"2026-08-02T11:50:21.988653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:50:22.099780Z","title":"FinBen : A holistic financial benchmark for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20491","last_updated":"2026-07-24T14:53:06Z","snapshot_observed_at":"2026-08-06T04:10:40.538060Z","submitted_at":"2026-06-10T03:31:09Z","title":"DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-02T11:50:22.099780Z"},"links":{"citing_paper":"/paper/2607.20491"},"observation_digest":"sha256:380f0b52d5cec62b913bfa8499c4af2f3a87faca121a2279ce010e02ac4779df","observation_id":"8c3c2a93-36e7-4936-9ca1-6d6aa44ccd25","resolution":{"observed_at":"2026-08-02T11:50:22.099780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:50:22.254315Z","title":"-bench : A benchmark for tool-agent-user interaction in real-world domains","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20491","last_updated":"2026-07-24T14:53:06Z","snapshot_observed_at":"2026-08-06T04:10:40.538060Z","submitted_at":"2026-06-10T03:31:09Z","title":"DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-02T11:50:22.254315Z"},"links":{"citing_paper":"/paper/2607.20491"},"observation_digest":"sha256:2810ee272876a4c16671b5e5685606e888f93246a9ac737d6c9afba5c7886961","observation_id":"afc9c533-1065-4080-bed3-7488956c3dc3","resolution":{"observed_at":"2026-08-02T11:50:22.254315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.20491","last_updated":"2026-07-24T14:53:06Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T04:10:40.538060Z","submitted_at":"2026-06-10T03:31:09Z","title":"DFAH-Bench: Benchmarking Observable Agent Instability in Financial Decision-Making"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 0 inbound Pith citation observations for arXiv:2607.20491."}