{"as_of":"2026-08-07T14:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1f7628193531e29ee41857354a199920af8601b688f22331a20f25e94443ff39","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:40:19.798011Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.12909/citation-record","integrity":"/paper/2506.12909/integrity","json":"/paper/2506.12909/citation-record.json","paper":"/paper/2506.12909"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T00:40:17.403722Z","title":"Training verifiers to solve math word problems, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-07T13:43:22.813866Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:17.403722Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:d6782e75ade25e7f9eab3b4768745dd838d3c482ba0d11e0453853098a133eba","observation_id":"241a3aa2-6484-475a-be7e-c8f7570e31e9","resolution":{"observed_at":"2026-08-07T00:40:17.403722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09783","last_updated":"2024-04-03T23:29:03Z","snapshot_observed_at":"2026-07-06T16:48:33.164024Z","submitted_at":"2023-11-16T11:03:04Z","title":"Investigating Data Contamination in Modern Benchmarks for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09783","snapshot_observed_at":"2026-08-07T00:40:17.481039Z","title":"Investigating data contamination in modern benchmarks for large language models.arXiv preprint arXiv:2311.09783, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-07T13:43:22.813866Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:17.481039Z"},"links":{"cited_paper":"/paper/2311.09783","citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:47ca4b129b99ac074e40d7074f66669841512d52ac4fb6299af718689b04de99","observation_id":"eb8820db-3ad5-485b-a6b4-cb0519f1b63c","resolution":{"observed_at":"2026-08-07T00:40:17.481039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15938","last_updated":"2024-05-31T17:49:03Z","snapshot_observed_at":"2026-08-03T17:29:17.531819Z","submitted_at":"2024-02-24T23:54:41Z","title":"Generalization or Memorization: Data Contamination and Trustworthy Evaluation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15938","snapshot_observed_at":"2026-08-07T00:40:17.556892Z","title":"Generalization or memorization: Data contamination and trustworthy evaluation for large language models.arXiv preprint arXiv:2402.15938, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-07T13:43:22.813866Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:17.556892Z"},"links":{"cited_paper":"/paper/2402.15938","citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:35a5d81fe50878d22df6ad8d854f60ee74f6b5a41dde252316b9ae78fb0f23d8","observation_id":"b1ae3ebf-d00b-4665-bc48-6d8bc0a8a3fb","resolution":{"observed_at":"2026-08-07T00:40:17.556892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-05T09:35:42.754650Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-07T00:40:17.637897Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-07T13:43:22.813866Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:17.637897Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:4f2a0dac92de2380a7597cea2871db67f71dae726cd6e1a02925c6999ea36bc6","observation_id":"7c5f84c5-589f-4ffe-9226-2f2ca8fa44f7","resolution":{"observed_at":"2026-08-07T00:40:17.637897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08493","last_updated":"2024-02-21T22:02:26Z","snapshot_observed_at":"2026-08-06T07:48:14.479004Z","submitted_at":"2023-08-16T16:48:57Z","title":"Time Travel in LLMs: Tracing Data Contamination in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08493","snapshot_observed_at":"2026-08-07T00:40:17.728137Z","title":"Time travel in llms: Tracing data contamination in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-07T13:43:22.813866Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:17.728137Z"},"links":{"cited_paper":"/paper/2308.08493","citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:206eaf39b68c085c312be6109272356d23084098ccecf1b4335d78430f10e364","observation_id":"15f1051b-fa73-48bc-ba92-004e9167202c","resolution":{"observed_at":"2026-08-07T00:40:17.728137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T00:40:17.873549Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems.arXiv preprint arXiv:2402.14008, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-07T13:43:22.813866Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:17.873549Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:d43e97ffe9d469aa84796a706a30957f2bcec9c46ab6489daf404bf3ee6955d7","observation_id":"5b78fc0c-a208-4c77-b19a-1a75b73dcc4e","resolution":{"observed_at":"2026-08-07T00:40:17.873549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T00:40:17.982572Z","title":"Measuring massive multitask language understanding, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-07T13:43:22.813866Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:17.982572Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:1f9a8f2e2cb5219768f3d4999cc56b4148f2c818be07f9e514ef66c52e6962b2","observation_id":"dd3ed0c4-a74d-4113-be0a-6713ad168c89","resolution":{"observed_at":"2026-08-07T00:40:17.982572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T00:40:18.081117Z","title":"Measuring mathematical problem solving with the math dataset, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-07T13:43:22.813866Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:18.081117Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:9ca3249591f2edabedcf806353e0a6d739820c5622c9e6b18450f38f4250b1d9","observation_id":"b8d4d6fa-6183-4bc5-a6e4-6a65fdad6da6","resolution":{"observed_at":"2026-08-07T00:40:18.081117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06453","last_updated":"2025-02-12T23:16:27Z","snapshot_observed_at":"2026-08-07T13:42:52.896081Z","submitted_at":"2025-02-10T13:31:46Z","title":"MATH-Perturb: Benchmarking LLMs' Math Reasoning Abilities against Hard Perturbations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06453","snapshot_observed_at":"2026-08-07T00:40:18.185258Z","title":"Math-perturb: Benchmarking llms’ math reasoning abilities against hard perturbations, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-07T13:43:22.813866Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:18.185258Z"},"links":{"cited_paper":"/paper/2502.06453","citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:b010fde106973a15fcf7cde9d08ae43797a06ebb5747dfa0d40cd4dbf2c64de0","observation_id":"664c6e48-9ff1-4dd0-a7c6-766a5956461f","resolution":{"observed_at":"2026-08-07T00:40:18.185258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12753","last_updated":"2025-03-06T12:55:25Z","snapshot_observed_at":"2026-07-06T18:33:07.118735Z","submitted_at":"2024-06-18T16:20:53Z","title":"OlympicArena: Benchmarking Multi-discipline Cognitive Reasoning for Superintelligent AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12753","snapshot_observed_at":"2026-08-07T00:40:18.218676Z","title":"Olympicarena: Benchmarking multi-discipline cognitive reasoning for superintelligent ai, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-07T13:43:22.813866Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:18.218676Z"},"links":{"cited_paper":"/paper/2406.12753","citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:11a27af237a366e2b676464539cdfdc2ce45c4108d54eef49f36a7261a078c2d","observation_id":"d688752e-87b5-4e7f-93e6-a2289253ee1f","resolution":{"observed_at":"2026-08-07T00:40:18.218676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:18.316148Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-07T13:43:22.813866Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:18.316148Z"},"links":{"citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:556225e29ba82d9109bcd58d4cdb71347ff171e5a01bcfec7aca2c6cf330a6d2","observation_id":"8e678f31-d963-49d1-971a-ad2e985f97c9","resolution":{"observed_at":"2026-08-07T00:40:18.316148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12209","last_updated":"2024-05-20T17:52:29Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:52:29Z","title":"MathBench: Evaluating the Theory and Application Proficiency of LLMs with a Hierarchical Mathematics Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12209","snapshot_observed_at":"2026-08-07T00:40:18.377180Z","title":"Mathbench: Evaluating the theory and application proficiency of llms with a hierarchical mathematics benchmark.arXiv preprint arXiv:2405.12209, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-07T13:43:22.813866Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:18.377180Z"},"links":{"cited_paper":"/paper/2405.12209","citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:90cdd9dff6e90a2ea554f665733486a1251f5b9fbf09a86f92c3822a18b3df6c","observation_id":"f9ff443f-a8d3-498e-b19a-149234f32a6a","resolution":{"observed_at":"2026-08-07T00:40:18.377180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17681","last_updated":"2024-06-26T15:21:49Z","snapshot_observed_at":"2026-07-06T18:36:51.761148Z","submitted_at":"2024-06-25T16:13:53Z","title":"VarBench: Robust Language Model Benchmarking Through Dynamic Variable Perturbation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17681","snapshot_observed_at":"2026-08-07T00:40:18.482624Z","title":"Varbench: Robust language model benchmarking through dynamic variable perturbation.arXiv preprint arXiv:2406.17681, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-07T13:43:22.813866Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:18.482624Z"},"links":{"cited_paper":"/paper/2406.17681","citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:6bb681de337c55ebd2a41833dbfd220643f8b4f45093a71d61a649936451fdb5","observation_id":"f3eca25f-0978-4c78-996a-cf6f2e0748a7","resolution":{"observed_at":"2026-08-07T00:40:18.482624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16074","last_updated":"2025-05-18T14:13:34Z","snapshot_observed_at":"2026-07-06T21:13:09.093282Z","submitted_at":"2025-04-22T17:53:29Z","title":"PHYBench: Holistic Evaluation of Physical Perception and Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16074","snapshot_observed_at":"2026-08-07T00:40:18.603262Z","title":"Phybench: Holistic evaluation of physical perception and reasoning in large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-07T13:43:22.813866Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:18.603262Z"},"links":{"cited_paper":"/paper/2504.16074","citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:d551348444dd9a0fdc19fc8c960ff56210f792331bfee4902b1ce3bda8328750","observation_id":"a7ec1267-8c38-4f5b-8ca6-c35061de6a75","resolution":{"observed_at":"2026-08-07T00:40:18.603262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:18.682689Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-07T13:43:22.813866Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:18.682689Z"},"links":{"citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:8fd3ca243ff3e8959f9f20c625a8d02657f9f7aaee8ef0f497e2d85424998115","observation_id":"1d399252-4e4a-4c94-b3ab-ff9171da74de","resolution":{"observed_at":"2026-08-07T00:40:18.682689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-07-06T21:27:13.399006Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14552","snapshot_observed_at":"2026-08-07T00:40:18.763963Z","title":"Korgym: A dynamic game platform for llm reasoning evaluation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-07T13:43:22.813866Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:18.763963Z"},"links":{"cited_paper":"/paper/2505.14552","citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:7769de3b89448a46ea378a042f2bf076aab079c209368d996eda828716631cd0","observation_id":"52deed96-16d2-4713-8ddf-670d7841766c","resolution":{"observed_at":"2026-08-07T00:40:18.763963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21380","last_updated":"2026-04-12T10:37:12Z","snapshot_observed_at":"2026-08-02T16:04:50.458535Z","submitted_at":"2025-03-27T11:20:17Z","title":"Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21380","snapshot_observed_at":"2026-08-07T00:40:18.835228Z","title":"Challenging the boundaries of reasoning: An olympiad-level math benchmark for large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-07T13:43:22.813866Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:18.835228Z"},"links":{"cited_paper":"/paper/2503.21380","citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:3e7856ea0d0c2e0f3a001cce6fcceb77004baf0cb76c9e99f262ade953043a71","observation_id":"6f35a244-14c2-4ca1-8316-62140a96778a","resolution":{"observed_at":"2026-08-07T00:40:18.835228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:20.860525Z","title":"Scieval: A multi-level large language model evaluation benchmark for scientific research","venue":null,"work_id":"d6e342ae-8078-42bd-b0d7-8d1330fa4811","year":2024},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-07T13:43:22.813866Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:18.960983Z"},"links":{"citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:515aa2571674bf20ee4c2908ea6147a858d038916bbf77c91a86072f30c3734f","observation_id":"fffff97d-0cb2-42b4-aad2-82c1f0559cf2","resolution":{"observed_at":"2026-08-07T00:40:20.933813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02884","last_updated":"2024-03-05T11:42:59Z","snapshot_observed_at":"2026-08-05T15:37:36.382807Z","submitted_at":"2024-03-05T11:42:59Z","title":"MathScale: Scaling Instruction Tuning for Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02884","snapshot_observed_at":"2026-08-07T00:40:19.025173Z","title":"Mathscale: Scaling instruction tuning for mathematical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-07T13:43:22.813866Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:19.025173Z"},"links":{"cited_paper":"/paper/2403.02884","citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:a326bb8d452747871cd1cb0ba22ab821f772eb732f525332a97d3b11cb92c18b","observation_id":"e507e180-796e-4956-a856-a3e75787d30a","resolution":{"observed_at":"2026-08-07T00:40:19.025173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14739","last_updated":"2025-03-28T15:21:44Z","snapshot_observed_at":"2026-07-29T21:41:16.650188Z","submitted_at":"2025-02-20T17:05:58Z","title":"SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14739","snapshot_observed_at":"2026-08-07T00:40:19.078364Z","title":"Supergpqa: Scaling llm evaluation across 285 graduate disciplines, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-07T13:43:22.813866Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:19.078364Z"},"links":{"cited_paper":"/paper/2502.14739","citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:892d887ff4630c84ed8cc73cb68ce28fe83548e26ab4e1226b54569599687553","observation_id":"316ea0fa-e33d-4f4d-be2e-14f9a2bf9bf4","resolution":{"observed_at":"2026-08-07T00:40:19.078364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10635","last_updated":"2024-06-28T08:24:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-20T07:01:57Z","title":"SciBench: Evaluating College-Level Scientific Problem-Solving Abilities of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10635","snapshot_observed_at":"2026-08-07T00:40:19.177005Z","title":"Scibench: Evaluating college-level scientific problem-solving abilities of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-07T13:43:22.813866Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:19.177005Z"},"links":{"cited_paper":"/paper/2307.10635","citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:dff93b8e44f6a3591f7c851340201f51887419d0189ef5a5c597a18f6a71299a","observation_id":"c772bb73-a74f-42a2-bbb0-64d4fcfd36cb","resolution":{"observed_at":"2026-08-07T00:40:19.177005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:20.772782Z","title":"MMLU-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":"945b6586-2f28-4899-966b-e5f188d1aaae","year":2024},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-07T13:43:22.813866Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:19.278263Z"},"links":{"citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:c4a69482df88d94c44285f97acc389be5d9dc13a181f14035ae94cc3d4799492","observation_id":"8b80a9ec-d002-44e2-9005-a69f2f63cafa","resolution":{"observed_at":"2026-08-07T00:40:20.807810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-08-07T12:51:50.861720Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-08-07T00:40:19.463215Z","title":"Agieval: A human-centric benchmark for evaluating foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-07T13:43:22.813866Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:19.463215Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:159fc3dd076367b3a03cef722dc7c7764f9de00b862db3211e7248eb0eab5873","observation_id":"73bcba91-64fb-4d43-a1be-866f254414ef","resolution":{"observed_at":"2026-08-07T00:40:19.463215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:20.662692Z","title":null,"venue":null,"work_id":"5d75df41-8804-4dc5-b3e1-c40378fccc69","year":null},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-07T13:43:22.813866Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:19.572022Z"},"links":{"citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:46d26a92d41cb722b7c06beaa44542cf8b09dafd1d94eb654d0a7012f759e5d7","observation_id":"571e002a-7c80-43ab-9279-6412b8dea91a","resolution":{"observed_at":"2026-08-07T00:40:20.720704Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:20.401358Z","title":"Griffiths, Electrodynamics Solution Manual by David J","venue":null,"work_id":"4970c9c4-99b9-47c6-8b31-03cd0fe7f055","year":null},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-07T13:43:22.813866Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:19.661100Z"},"links":{"citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:a6afc36d9e00a62b32b0a0e492ba6298fae64940d4179a28fb3421fe952462e5","observation_id":"ab7958ff-c5c9-4657-966d-45f1981013a5","resolution":{"observed_at":"2026-08-07T00:40:20.559901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:40:20.173358Z","title":"elbow point","venue":null,"work_id":"6d3c8fe1-f831-4754-b2b9-e4d2dce6d285","year":null},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-07T13:43:22.813866Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:19.798011Z"},"links":{"citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:3b83f5964c7378630feca97e83c3c771f4502de9ff6547b978f5575e722f8b2d","observation_id":"ebb062cb-0ba5-457d-941c-29861ef35887","resolution":{"observed_at":"2026-08-07T00:40:20.249520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T13:43:22.813866Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2506.12909."}