{"as_of":"2026-08-07T17:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:79ecebd970c491ec1c14b182c0a17906bddce22581ab5ed240d6f94edb675f4a","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:28:28.305782Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.19409/citation-record","integrity":"/paper/2607.19409/integrity","json":"/paper/2607.19409/citation-record.json","paper":"/paper/2607.19409"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-02T07:28:26.789516Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.19409","last_updated":"2026-07-11T01:16:31Z","snapshot_observed_at":"2026-08-06T17:51:35.890942Z","submitted_at":"2026-07-11T01:16:31Z","title":"FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T07:28:26.789516Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2607.19409"},"observation_digest":"sha256:cf5d8b5103b103a4a964326b01adb9da413a3e93bd9eda3b29a23e7e9ec4cf5b","observation_id":"b31f1b67-5e0d-47a6-a8f9-dbe2ecd3160d","resolution":{"observed_at":"2026-08-02T07:28:26.789516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-02T07:28:27.218847Z","title":"React: Synergizing reasoning and acting in language models.arXiv preprint arXiv:2210.03629, 2022a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19409","last_updated":"2026-07-11T01:16:31Z","snapshot_observed_at":"2026-08-06T17:51:35.890942Z","submitted_at":"2026-07-11T01:16:31Z","title":"FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T07:28:27.218847Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2607.19409"},"observation_digest":"sha256:48bffc00eeffa160e0cac22bedf04f47bd65dbf0c3700e3deb26309a1229956e","observation_id":"22a1ffc2-af03-43d1-a694-b16ae67d98e2","resolution":{"observed_at":"2026-08-02T07:28:27.218847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-02T07:28:27.572571Z","title":"Constitutional ai: Harmlessness from ai feedback.arXiv preprint arXiv:2212.08073,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19409","last_updated":"2026-07-11T01:16:31Z","snapshot_observed_at":"2026-08-06T17:51:35.890942Z","submitted_at":"2026-07-11T01:16:31Z","title":"FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T07:28:27.572571Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2607.19409"},"observation_digest":"sha256:756ae60c04eb254affabc178a9d04b6f461f6d9b4bc61a987d744006c5ee510b","observation_id":"f515aa51-163b-4448-a82e-a3516508334b","resolution":{"observed_at":"2026-08-02T07:28:27.572571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11944","last_updated":"2023-11-20T17:28:02Z","snapshot_observed_at":"2026-07-06T16:50:06.095609Z","submitted_at":"2023-11-20T17:28:02Z","title":"FinanceBench: A New Benchmark for Financial Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11944","snapshot_observed_at":"2026-08-02T07:28:27.670122Z","title":"Financebench: A new benchmark for financial question answering.arXiv preprint arXiv:2311.11944,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19409","last_updated":"2026-07-11T01:16:31Z","snapshot_observed_at":"2026-08-06T17:51:35.890942Z","submitted_at":"2026-07-11T01:16:31Z","title":"FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T07:28:27.670122Z"},"links":{"cited_paper":"/paper/2311.11944","citing_paper":"/paper/2607.19409"},"observation_digest":"sha256:dbd3a62930a71fc6e62a7874a8adbbdc199b6c4c52d194963f22f483a7b1e4f5","observation_id":"68c84230-0719-4077-9057-3a32963a2eda","resolution":{"observed_at":"2026-08-02T07:28:27.670122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17564","last_updated":"2023-12-21T06:21:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-30T17:30:36Z","title":"BloombergGPT: A Large Language Model for Finance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17564","snapshot_observed_at":"2026-08-02T07:28:27.822002Z","title":"Bloomberggpt: A large language model for finance.arXiv preprint arXiv:2303.17564,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19409","last_updated":"2026-07-11T01:16:31Z","snapshot_observed_at":"2026-08-06T17:51:35.890942Z","submitted_at":"2026-07-11T01:16:31Z","title":"FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T07:28:27.822002Z"},"links":{"cited_paper":"/paper/2303.17564","citing_paper":"/paper/2607.19409"},"observation_digest":"sha256:436ec0bd76091be6a3ef0ccd8818a878f64d4899657f92e1436d79b299c24f2c","observation_id":"44310c14-dce8-47fd-950a-f33026be4fe7","resolution":{"observed_at":"2026-08-02T07:28:27.822002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12659","last_updated":"2024-06-19T03:38:56Z","snapshot_observed_at":"2026-08-02T08:16:49.760328Z","submitted_at":"2024-02-20T02:16:16Z","title":"FinBen: A Holistic Financial Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12659","snapshot_observed_at":"2026-08-02T07:28:27.915579Z","title":"Finben: A holistic financial benchmark for large language models.arXiv preprint arXiv:2402.12659,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19409","last_updated":"2026-07-11T01:16:31Z","snapshot_observed_at":"2026-08-06T17:51:35.890942Z","submitted_at":"2026-07-11T01:16:31Z","title":"FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T07:28:27.915579Z"},"links":{"cited_paper":"/paper/2402.12659","citing_paper":"/paper/2607.19409"},"observation_digest":"sha256:d94a155daa1735eca8cec058f1d081c95c10eaa3218045ed0078f7856abaef5b","observation_id":"caa583bb-3902-4f43-824b-7bd4ac920338","resolution":{"observed_at":"2026-08-02T07:28:27.915579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:28:28.015941Z","title":"Webshop: Towards scalable real-world web interaction with grounded language agents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19409","last_updated":"2026-07-11T01:16:31Z","snapshot_observed_at":"2026-08-06T17:51:35.890942Z","submitted_at":"2026-07-11T01:16:31Z","title":"FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T07:28:28.015941Z"},"links":{"citing_paper":"/paper/2607.19409"},"observation_digest":"sha256:2670db8253c758d55d66ec4c39707fd3f2be05f2036e0e2e56aabfaa74525951","observation_id":"c3898d70-b1f3-4b57-8cda-5d3fef0b90c6","resolution":{"observed_at":"2026-08-02T07:28:28.015941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00828","last_updated":"2025-05-20T18:22:10Z","snapshot_observed_at":"2026-08-07T15:30:31.121575Z","submitted_at":"2025-05-20T18:22:10Z","title":"Finance Agent Benchmark: Benchmarking LLMs on Real-world Financial Research Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.00828","snapshot_observed_at":"2026-08-02T07:28:28.105727Z","title":"Finance agent benchmark: Benchmarking llms on real-world financial research tasks.arXiv preprint arXiv:2508.00828,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19409","last_updated":"2026-07-11T01:16:31Z","snapshot_observed_at":"2026-08-06T17:51:35.890942Z","submitted_at":"2026-07-11T01:16:31Z","title":"FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T07:28:28.105727Z"},"links":{"cited_paper":"/paper/2508.00828","citing_paper":"/paper/2607.19409"},"observation_digest":"sha256:3dd32ceb3a06e9fc291dee2a5a92811cd5ac72042a0e4db60ad01478bf61a9f7","observation_id":"61116e77-9e8f-44a3-84c3-56f372496f87","resolution":{"observed_at":"2026-08-02T07:28:28.105727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03714","last_updated":"2023-10-05T17:37:25Z","snapshot_observed_at":"2026-08-04T05:21:05.846165Z","submitted_at":"2023-10-05T17:37:25Z","title":"DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03714","snapshot_observed_at":"2026-08-02T07:28:28.252341Z","title":"Dspy: Compiling declarative language model calls into self-improving pipelines.arXiv preprint arXiv:2310.03714,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19409","last_updated":"2026-07-11T01:16:31Z","snapshot_observed_at":"2026-08-06T17:51:35.890942Z","submitted_at":"2026-07-11T01:16:31Z","title":"FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T07:28:28.252341Z"},"links":{"cited_paper":"/paper/2310.03714","citing_paper":"/paper/2607.19409"},"observation_digest":"sha256:d6b8df53ac8f22b4326169223b1e724a52ef08242a03c1b89f72ad3a1aac927f","observation_id":"7a7725a0-a606-4fed-86dd-a764ef40dd35","resolution":{"observed_at":"2026-08-02T07:28:28.252341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:28:28.305782Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19409","last_updated":"2026-07-11T01:16:31Z","snapshot_observed_at":"2026-08-06T17:51:35.890942Z","submitted_at":"2026-07-11T01:16:31Z","title":"FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance","version":1},"reference_index":1986,"source":"pdf_text","source_observed_at":"2026-08-02T07:28:28.305782Z"},"links":{"citing_paper":"/paper/2607.19409"},"observation_digest":"sha256:38f1d395ebddef7bcfc51a52c254e472856b758f25e809d4d5448133d99740b7","observation_id":"6b534a3b-1b4f-4ec0-8759-08d03701536d","resolution":{"observed_at":"2026-08-02T07:28:28.305782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-02T07:28:27.448754Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19409","last_updated":"2026-07-11T01:16:31Z","snapshot_observed_at":"2026-08-06T17:51:35.890942Z","submitted_at":"2026-07-11T01:16:31Z","title":"FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-02T07:28:27.448754Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.19409"},"observation_digest":"sha256:22903de839ed2679905c6641f532b89498e5047ed476f0a3d059fff8c85e5176","observation_id":"22851a93-4ba1-4e46-bc9c-ef237c429330","resolution":{"observed_at":"2026-08-02T07:28:27.448754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:28:26.909728Z","title":"Agentbench: Evaluating llms as agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19409","last_updated":"2026-07-11T01:16:31Z","snapshot_observed_at":"2026-08-06T17:51:35.890942Z","submitted_at":"2026-07-11T01:16:31Z","title":"FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T07:28:26.909728Z"},"links":{"citing_paper":"/paper/2607.19409"},"observation_digest":"sha256:3eff8e26d9e7a6a09f59e62c4a8c7592e9ad41de72e0ad2b73868f9d5518ef33","observation_id":"a0e367aa-f3ab-449b-a20e-e680e8e7f2d0","resolution":{"observed_at":"2026-08-02T07:28:26.909728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:28:27.496811Z","title":"Squad: 100,000+ questions for machine comprehension of text","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.19409","last_updated":"2026-07-11T01:16:31Z","snapshot_observed_at":"2026-08-06T17:51:35.890942Z","submitted_at":"2026-07-11T01:16:31Z","title":"FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T07:28:27.496811Z"},"links":{"citing_paper":"/paper/2607.19409"},"observation_digest":"sha256:254a930be1d70d6d7557e9a385dc4e21509839ba0cec8288e6900ffb39955f20","observation_id":"f49e471a-ecac-4d35-8514-f1957937a6b3","resolution":{"observed_at":"2026-08-02T07:28:27.496811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-02T22:19:29.043854Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-08-02T07:28:27.124883Z","title":"τ-bench: A benchmark for tool-agent-user interaction in real-world domains.arXiv preprint arXiv:2406.12045,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19409","last_updated":"2026-07-11T01:16:31Z","snapshot_observed_at":"2026-08-06T17:51:35.890942Z","submitted_at":"2026-07-11T01:16:31Z","title":"FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T07:28:27.124883Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2607.19409"},"observation_digest":"sha256:33dd356b2d1d8d2f5630de0ea337b0c26f7d5a0b7f59db9fd164465f4985a2f6","observation_id":"40fefacf-6cab-4739-8f5a-94c6d414a3cc","resolution":{"observed_at":"2026-08-02T07:28:27.124883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:28:28.178907Z","title":"Finagentbench: A benchmark dataset for agentic retrieval in financial question answering.arXiv preprint arXiv:2508.14052,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19409","last_updated":"2026-07-11T01:16:31Z","snapshot_observed_at":"2026-08-06T17:51:35.890942Z","submitted_at":"2026-07-11T01:16:31Z","title":"FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T07:28:28.178907Z"},"links":{"citing_paper":"/paper/2607.19409"},"observation_digest":"sha256:0d37be93a35b6e23f9dc66cc8352b000d0cdc82d6c105ec6c95aff8d4086281c","observation_id":"17ed29f9-0903-4520-ba97-7e2a381c8c71","resolution":{"observed_at":"2026-08-02T07:28:28.178907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-02T07:28:27.319464Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19409","last_updated":"2026-07-11T01:16:31Z","snapshot_observed_at":"2026-08-06T17:51:35.890942Z","submitted_at":"2026-07-11T01:16:31Z","title":"FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T07:28:27.319464Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2607.19409"},"observation_digest":"sha256:d0f29e0d6122f90a2a58cecd83dec9d94f371e02f2d92effe4249239286381af","observation_id":"a4bab4d4-68bd-4aa2-8ec9-bc873166f416","resolution":{"observed_at":"2026-08-02T07:28:27.319464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.19409","last_updated":"2026-07-11T01:16:31Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T17:51:35.890942Z","submitted_at":"2026-07-11T01:16:31Z","title":"FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 0 inbound Pith citation observations for arXiv:2607.19409."}