{"as_of":"2026-08-12T07:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a54dc09d6a77b7b30c74518536edd1f93922e6cf0338f65c05fc836b36b86111","coverage":[{"denominator":5,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T00:53:29.689406Z","state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:01:16.726294Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T08:56:25.216379Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.18062","last_updated":"2025-01-30T00:06:55Z","snapshot_observed_at":"2026-08-11T03:07:41.415084Z","submitted_at":"2025-01-30T00:06:55Z","title":"FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18062","snapshot_observed_at":"2026-08-07T14:01:16.726294Z","title":"Financeqa: A benchmark for evaluating financial analysis capabilities of large language models.arXiv preprint arXiv:2501.18062, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20246","last_updated":"2025-06-19T15:42:45Z","snapshot_observed_at":"2026-08-09T21:27:49.188739Z","submitted_at":"2025-05-26T17:22:20Z","title":"On Path to Multimodal Historical Reasoning: HistBench and HistAgent","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:01:16.726294Z"},"links":{"cited_paper":"/paper/2501.18062","citing_paper":"/paper/2505.20246"},"observation_digest":"sha256:c0c450eb51064034d41f9ec7c30054e2b21e849f578a4e3aaf5dee2b95e09bbe","observation_id":"b5cbb368-61f5-41b7-a401-2147d79c0faa","resolution":{"observed_at":"2026-08-07T14:01:16.726294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18062","last_updated":"2025-01-30T00:06:55Z","snapshot_observed_at":"2026-08-11T03:07:41.415084Z","submitted_at":"2025-01-30T00:06:55Z","title":"FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models","version":1},"cited_work":{"arxiv_id":"2501.18062","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18062","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Financeqa: a benchmark for evaluating financial analysis capabilities of large language models.arXiv preprint arXiv:2501.18062","venue":null,"work_id":"7890ea50-c32a-40eb-a167-f9d2775e8355","year":2025},"citing_paper":{"arxiv_id":"2604.06132","last_updated":"2026-05-07T14:06:23Z","snapshot_observed_at":"2026-08-11T13:25:57.999910Z","submitted_at":"2026-04-07T17:43:18Z","title":"Claw-Eval: Towards Trustworthy Evaluation of Autonomous Agents","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T18:59:59.383781Z"},"links":{"cited_paper":"/paper/2501.18062","citing_paper":"/paper/2604.06132"},"observation_digest":"sha256:5b27e11fea04562cda128dc8360703679bfd902798257c8416617ecf8f927ca4","observation_id":"2fbc8455-1593-4cd7-8fff-6dce4cc607e4","resolution":{"observed_at":"2026-05-10T23:35:51.605474Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18062","last_updated":"2025-01-30T00:06:55Z","snapshot_observed_at":"2026-08-11T03:07:41.415084Z","submitted_at":"2025-01-30T00:06:55Z","title":"FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models","version":1},"cited_work":{"arxiv_id":"2501.18062","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18062","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Financeqa: a benchmark for evaluating financial analysis capabilities of large language models.arXiv preprint arXiv:2501.18062","venue":null,"work_id":"7890ea50-c32a-40eb-a167-f9d2775e8355","year":2025},"citing_paper":{"arxiv_id":"2604.17305","last_updated":"2026-04-19T07:42:07Z","snapshot_observed_at":"2026-08-11T02:09:45.558861Z","submitted_at":"2026-04-19T07:42:07Z","title":"BizCompass: Benchmarking the Reasoning Capabilities of LLMs in Business Knowledge and Applications","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T05:52:40.026883Z"},"links":{"cited_paper":"/paper/2501.18062","citing_paper":"/paper/2604.17305"},"observation_digest":"sha256:cb4ff7448dc3adacdaf4c5600450520d5d9c2d4753ffa4a4e47dc95fb8833911","observation_id":"12905610-f501-471c-8f08-6dbd8eade104","resolution":{"observed_at":"2026-05-10T05:56:11.234156Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18062","last_updated":"2025-01-30T00:06:55Z","snapshot_observed_at":"2026-08-11T03:07:41.415084Z","submitted_at":"2025-01-30T00:06:55Z","title":"FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models","version":1},"cited_work":{"arxiv_id":"2501.18062","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18062","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Financeqa: a benchmark for evaluating financial analysis capabilities of large language models.arXiv preprint arXiv:2501.18062","venue":null,"work_id":"7890ea50-c32a-40eb-a167-f9d2775e8355","year":2025},"citing_paper":{"arxiv_id":"2604.26235","last_updated":"2026-04-29T02:32:14Z","snapshot_observed_at":"2026-08-11T14:48:03.327957Z","submitted_at":"2026-04-29T02:32:14Z","title":"LATTICE: Evaluating Decision Support Utility of Crypto Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-07T13:30:46.523784Z"},"links":{"cited_paper":"/paper/2501.18062","citing_paper":"/paper/2604.26235"},"observation_digest":"sha256:16165e4fa05db69f22a59ae3ef7ddf7cc28683abd8275c755d835642dc6b5ca1","observation_id":"13123e87-942a-4f52-a066-c3c8fae96dff","resolution":{"observed_at":"2026-05-12T08:56:25.221197Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18062","last_updated":"2025-01-30T00:06:55Z","snapshot_observed_at":"2026-08-11T03:07:41.415084Z","submitted_at":"2025-01-30T00:06:55Z","title":"FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models","version":1},"cited_work":{"arxiv_id":"2501.18062","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18062","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Financeqa: a benchmark for evaluating financial analysis capabilities of large language models.arXiv preprint arXiv:2501.18062","venue":null,"work_id":"7890ea50-c32a-40eb-a167-f9d2775e8355","year":2025},"citing_paper":{"arxiv_id":"2605.09106","last_updated":"2026-05-09T18:28:40Z","snapshot_observed_at":"2026-08-02T14:28:15.824774Z","submitted_at":"2026-05-09T18:28:40Z","title":"Fin-Bias: Comprehensive Evaluation for LLM Decision-Making under human bias in Finance Domain","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-12T02:15:53.024591Z"},"links":{"cited_paper":"/paper/2501.18062","citing_paper":"/paper/2605.09106"},"observation_digest":"sha256:a67831e6cf456455a5bf977c8b5f4e38e29b0f2d484f5eb00634831ca35fddb6","observation_id":"63f6b8a0-ee55-448e-b67a-77b42fa61a60","resolution":{"observed_at":"2026-05-12T02:16:15.789703Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.18062/citation-record","integrity":"/paper/2501.18062/integrity","json":"/paper/2501.18062/citation-record.json","paper":"/paper/2501.18062"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2109.00122","last_updated":"2022-05-07T07:52:39Z","snapshot_observed_at":"2026-08-11T03:07:17.578573Z","submitted_at":"2021-09-01T00:08:14Z","title":"FinQA: A Dataset of Numerical Reasoning over Financial Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00122","snapshot_observed_at":"2026-08-10T00:53:29.668745Z","title":"& Wang, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18062","last_updated":"2025-01-30T00:06:55Z","snapshot_observed_at":"2026-08-11T03:07:41.415084Z","submitted_at":"2025-01-30T00:06:55Z","title":"FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T00:53:29.668745Z"},"links":{"cited_paper":"/paper/2109.00122","citing_paper":"/paper/2501.18062"},"observation_digest":"sha256:0328e2c583129a1c2cb88c201c4c45dc36b61ba9028ff436a31ca195d831c5c5","observation_id":"e72439a9-86fe-476f-aab3-5a609cab0709","resolution":{"observed_at":"2026-08-10T00:53:29.668745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11944","last_updated":"2023-11-20T17:28:02Z","snapshot_observed_at":"2026-08-10T08:01:44.134932Z","submitted_at":"2023-11-20T17:28:02Z","title":"FinanceBench: A New Benchmark for Financial Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11944","snapshot_observed_at":"2026-08-10T00:53:29.678903Z","title":"arXiv preprint arXiv:2311.11944 Koller, T., Goedhart, M., & Wessels, D","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.18062","last_updated":"2025-01-30T00:06:55Z","snapshot_observed_at":"2026-08-11T03:07:41.415084Z","submitted_at":"2025-01-30T00:06:55Z","title":"FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T00:53:29.678903Z"},"links":{"cited_paper":"/paper/2311.11944","citing_paper":"/paper/2501.18062"},"observation_digest":"sha256:60bed2ecc634b1a109836762f9bb31a971056eade175ce3b7495308343f16021","observation_id":"474df27b-e50d-4e34-bc2a-f91db76556c0","resolution":{"observed_at":"2026-08-10T00:53:29.678903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01769","last_updated":"2024-11-21T23:39:12Z","snapshot_observed_at":"2026-08-06T16:39:54.371324Z","submitted_at":"2024-05-02T22:43:02Z","title":"A Survey on Large Language Models for Critical Societal Domains: Finance, Healthcare, and Law","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01769","snapshot_observed_at":"2026-08-10T00:53:29.689406Z","title":"Materiality","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2501.18062","last_updated":"2025-01-30T00:06:55Z","snapshot_observed_at":"2026-08-11T03:07:41.415084Z","submitted_at":"2025-01-30T00:06:55Z","title":"FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-10T00:53:29.689406Z"},"links":{"cited_paper":"/paper/2405.01769","citing_paper":"/paper/2501.18062"},"observation_digest":"sha256:7782878c39afb896d8c964e59a6ef30e6fda06821a2746e0ce4dd9e382bc6524","observation_id":"2a1c8f9d-32ed-492d-a6d9-ba31d633346c","resolution":{"observed_at":"2026-08-10T00:53:29.689406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11462","last_updated":"2023-08-20T22:08:03Z","snapshot_observed_at":"2026-08-03T20:35:47.668090Z","submitted_at":"2023-08-20T22:08:03Z","title":"LegalBench: A Collaboratively Built Benchmark for Measuring Legal Reasoning in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11462","snapshot_observed_at":"2026-08-10T00:53:29.674023Z","title":"arXiv preprint arXiv:2308.11462","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18062","last_updated":"2025-01-30T00:06:55Z","snapshot_observed_at":"2026-08-11T03:07:41.415084Z","submitted_at":"2025-01-30T00:06:55Z","title":"FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T00:53:29.674023Z"},"links":{"cited_paper":"/paper/2308.11462","citing_paper":"/paper/2501.18062"},"observation_digest":"sha256:65528696342c51ab125b8d0d4a07a9685858e6510c8f8f059f7c3945823c31f9","observation_id":"8a430616-9e27-4c79-a038-68fdfff5f118","resolution":{"observed_at":"2026-08-10T00:53:29.674023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07565","last_updated":"2024-10-03T16:48:55Z","snapshot_observed_at":"2026-08-04T18:31:06.905572Z","submitted_at":"2024-07-10T11:50:20Z","title":"On Leakage of Code Generation Evaluation Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07565","snapshot_observed_at":"2026-08-10T00:53:29.683526Z","title":"arXiv preprint arXiv:2407.07565","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18062","last_updated":"2025-01-30T00:06:55Z","snapshot_observed_at":"2026-08-11T03:07:41.415084Z","submitted_at":"2025-01-30T00:06:55Z","title":"FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T00:53:29.683526Z"},"links":{"cited_paper":"/paper/2407.07565","citing_paper":"/paper/2501.18062"},"observation_digest":"sha256:4925ed5274e752c92fc2c196a3d87e30981c51045c87110a0ab8e998d3f9243b","observation_id":"7a0ac1f2-210a-47c6-9806-17bf56a4be43","resolution":{"observed_at":"2026-08-10T00:53:29.683526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.18062","last_updated":"2025-01-30T00:06:55Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T03:07:41.415084Z","submitted_at":"2025-01-30T00:06:55Z","title":"FinanceQA: A Benchmark for Evaluating Financial Analysis Capabilities of Large Language Models"},"reference_resolution":{"displayed":5,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":5},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 5 of 5 outbound references and 5 inbound Pith citation observations for arXiv:2501.18062."}