{"as_of":"2026-08-23T08:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9ec0fb71940727e5aa722e248bac6d4156cbb3b33825dc154c250d96523acfed","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T04:51:49.138026Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.27047/citation-record","integrity":"/paper/2606.27047/integrity","json":"/paper/2606.27047/citation-record.json","paper":"/paper/2606.27047"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.10920","last_updated":"2023-10-17T01:27:20Z","snapshot_observed_at":"2026-08-19T00:58:27.776606Z","submitted_at":"2023-10-17T01:27:20Z","title":"NuclearQA: A Human-Made Benchmark for Language Models for the Nuclear Domain","version":1},"cited_work":{"arxiv_id":"2310.10920","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.10920","snapshot_observed_at":"2026-07-04T13:49:52.281505Z","title":"NuclearQA: A human-made benchmark for language models for the nuclear domain.arXiv preprint arXiv:2310.10920, 2023","venue":null,"work_id":"3fa1106d-d8dd-44c6-83fa-933d415466c6","year":2023},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"cited_paper":"/paper/2310.10920","citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:287eb4f77e0ef9199e20caec5bcfaa94dbdb7ce151d397eb64d3e338ff09762b","observation_id":"9829b096-cb5f-477b-b48e-badb83f263a6","resolution":{"observed_at":"2026-07-04T13:49:52.283299Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:65bfe8f17e102af5cb45fbaeb0e4951732f2819645fe203eae1b21efc41abc51","observation_id":"21013d31-042e-4728-812c-52faf585fb41","resolution":{"observed_at":"2026-07-04T13:49:52.283693Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.11562","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:40:08.255305Z","title":"Prbench: Large-scale expert rubrics for evaluating high-stakes professional reasoning.arXiv preprint arXiv:2511.11562","venue":null,"work_id":"d0343a4c-9767-4d3c-ab40-27caf9931674","year":2025},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:13bf35c473c3a62be2c219745fe28be19102e82aeeee3383647d715308f1aa9d","observation_id":"8ffdd436-5a77-4c63-ae89-cd47b32077aa","resolution":{"observed_at":"2026-07-04T13:49:52.280343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T04:51:49.138026Z","title":"Synthetic QA corpora generation with roundtrip consistency","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:49d9f4adc6620fde8ab78a1e37cf2ba316ac8bca5f4b8a9f111b30676d2c5463","observation_id":"ec0191a9-cedd-4e43-b29e-53c3afda9134","resolution":{"observed_at":"2026-06-26T04:51:49.138026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13418","last_updated":"2023-08-25T15:03:36Z","snapshot_observed_at":"2026-08-12T03:48:04.422679Z","submitted_at":"2023-08-25T15:03:36Z","title":"Nougat: Neural Optical Understanding for Academic Documents","version":1},"cited_work":{"arxiv_id":"2308.13418","doi":"10.48550/arxiv.2308.13418","metadata_source":"pith","pith_arxiv_id":"2308.13418","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nougat: Neural Optical Understanding for Academic Documents","venue":"cs.LG","work_id":"26c3b627-7e97-40d7-bab3-020936b8196b","year":2023},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"cited_paper":"/paper/2308.13418","citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:f96b8a9792ed6b4575ab61e823a7af86ed6ae6ae87f4aa34447392d42f906610","observation_id":"ae440e9b-5fa0-414a-b60e-8856902d0ebd","resolution":{"observed_at":"2026-07-04T13:49:52.274705Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T04:51:49.138026Z","title":"Language models are few-shot learners.Advances in Neural Information Processing Systems, 33:1877–1901, 2020","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:a2e495b01da308410113e3177157bc70510caf88fe988e12e7a2f4f9779721f7","observation_id":"9c0db56d-d097-4acd-a98f-9d878f62d636","resolution":{"observed_at":"2026-06-26T04:51:49.138026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T04:51:49.138026Z","title":"A survey on evaluation of large language models.ACM transactions on Intelligent Systems and Technology, 15(3):1–45, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:50e205ceda41455d08501ad0e4e13f3884e3c2a602dbb49d4988151a70a187da","observation_id":"37c5ede6-3cc1-4847-8c93-85058bbb8d2c","resolution":{"observed_at":"2026-06-26T04:51:49.138026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01769","last_updated":"2024-11-21T23:39:12Z","snapshot_observed_at":"2026-08-16T13:55:47.478674Z","submitted_at":"2024-05-02T22:43:02Z","title":"A Survey on Large Language Models for Critical Societal Domains: Finance, Healthcare, and Law","version":2},"cited_work":{"arxiv_id":"2405.01769","doi":"10.48550/arxiv.2405.01769","metadata_source":"pith","pith_arxiv_id":"2405.01769","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey on Large Language Models for Critical Societal Domains: Finance, Healthcare, and Law","venue":"cs.CL","work_id":"692402f6-62ca-4f46-a6ff-c1dd81c5eeb8","year":2024},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"cited_paper":"/paper/2405.01769","citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:b98247fc87f37e78f11cad40ea94e652fb11e562e8876f862c1017637d1cf4a2","observation_id":"dc855fb9-39a1-404b-bed1-f92377b3c823","resolution":{"observed_at":"2026-07-04T13:49:52.305518Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:21:09.433752+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:21:09.433752+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:3029e9d9979f6ac86d595107fe94a95b9697f1e764f69309ace6074f6673530d","observation_id":"fc1ba279-0685-45a9-9af6-afd93945df52","resolution":{"observed_at":"2026-07-04T13:49:52.301039Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T04:51:49.138026Z","title":"LegalBench: A collaboratively built benchmark for measuring legal reasoning in large language models.Advances in Neural Information Processing Systems, 36:44123–44279, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:2a795c0e690559fa028f7d4368c14e3397c4fa0824858e285bb86ed8ad0484d7","observation_id":"07cc8909-a109-48c2-9a1a-1162358c365a","resolution":{"observed_at":"2026-06-26T04:51:49.138026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:0907368e0013abdb3ffdbe36939a256fbb73d245ca260ffc2a649ea0ca0df26d","observation_id":"5c50b657-2e31-4e3f-96f3-0a376d0f9d00","resolution":{"observed_at":"2026-07-04T13:49:52.302205Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-08-21T04:25:41.592030Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:f2269ba7caccd104fa67b48cae22ed22d2bf10cd589b0ce98725a57ade74ea6f","observation_id":"ba860b65-7835-49ec-b6f4-fc0627c7d12c","resolution":{"observed_at":"2026-07-04T13:49:52.309083Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T04:51:49.138026Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions.ACM Transactions on Information Systems, 43(2):1–55, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:ba2309647c53b2be5c7c704ce02d07c9dd14d78e4c26ba07d0e4f5e1a9806499","observation_id":"4bd36d78-d83c-43de-b001-448ad8a5b306","resolution":{"observed_at":"2026-06-26T04:51:49.138026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T04:51:49.138026Z","title":"Towards mitigating llm hallucination via self reflection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:2beeb8cb35618e4fbeeccd3114d36487c8b1af60553189db3c9363b7b30807f1","observation_id":"9ace6daf-3051-4711-960e-768fe792592c","resolution":{"observed_at":"2026-06-26T04:51:49.138026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T04:51:49.138026Z","title":"Select high-quality synthetic QA pairs to augment training data in MRC under the reward guidance of generative language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:111ec1f5fd13520c800a9ef8c37a0e876b10dbf312218c17d4421a4d7f8ed767","observation_id":"cb0475b5-6764-41d7-873d-413daae83bed","resolution":{"observed_at":"2026-06-26T04:51:49.138026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T04:51:49.138026Z","title":"American Institute of Physics, 1977","venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:dde78dc702f35867a391e400dfd75c08315f1893bcbfd38b1b5907e7be1742c7","observation_id":"1fb487ad-8d67-4eb6-82c8-2b1241c09761","resolution":{"observed_at":"2026-06-26T04:51:49.138026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:611e1a02b1bc44d7acc17cd47314f10d37b94dc5fff9f9e6b203ca1760f1489c","observation_id":"0aa74a25-50b1-487b-b8ca-aaf118fdf5e6","resolution":{"observed_at":"2026-07-04T13:49:52.290181Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T04:51:49.138026Z","title":"G-Eval: NLG evaluation using GPT-4 with better human alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:6ef3e3c9166e68b69d20767ec6d29ba7f46b010308a63399d410140a49230498","observation_id":"1b4503b4-7461-47b2-a053-828161c7c822","resolution":{"observed_at":"2026-06-26T04:51:49.138026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T04:51:49.138026Z","title":"ExpertQA: Expert-curated questions and attributed answers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:5d69f4a5fabc1f8f265c87e27819ee11073b93353dce95cc2a214cf7e2cc8303","observation_id":"692e06f8-6636-4c9d-bb83-b6b776ce3468","resolution":{"observed_at":"2026-06-26T04:51:49.138026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T04:51:49.138026Z","title":"Sources of hallucination by large language models on inference tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:73a1621243a1789aa27961c1bce55a4c1e0e4551cbfb6b55bf16d61517df484c","observation_id":"aaa36e4a-54ca-4aa5-8f17-cbfa2e7361e8","resolution":{"observed_at":"2026-06-26T04:51:49.138026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T04:51:49.138026Z","title":"Training question answering models from synthetic data","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:179c03c2df6d58b20ae494aab35d282260005576ee5fbffeb6dc6a9a6415a82d","observation_id":"00c0789d-e639-4436-8e2a-c8dade83fadd","resolution":{"observed_at":"2026-06-26T04:51:49.138026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T04:51:49.138026Z","title":"SQuAD: 100,000+ questions for machine comprehension of text","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:aca54fb2a87173cd4c8e088ca9dfd14150035db110fc6228eded6c901b1f9ed9","observation_id":"634cd975-9cf9-415a-8422-bcf896036e17","resolution":{"observed_at":"2026-06-26T04:51:49.138026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05922","last_updated":"2023-09-12T02:34:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-12T02:34:06Z","title":"A Survey of Hallucination in Large Foundation Models","version":1},"cited_work":{"arxiv_id":"2309.05922","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.05922","snapshot_observed_at":"2026-07-04T19:50:11.151420Z","title":"A Survey of Hallucination in Large Foundation Models","venue":"cs.AI","work_id":"1b84f221-37fa-403a-9bf4-1741910454bf","year":2023},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"cited_paper":"/paper/2309.05922","citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:9375d71408dafda22a076f702d17c9b5c11bb7b10a7da068cbb443a86efde7b8","observation_id":"9763c8e9-ad30-4410-8908-7028a63b7774","resolution":{"observed_at":"2026-07-04T13:49:52.295588Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T04:51:49.138026Z","title":"Ubiquity of LLM hallucinations across critical domains: A survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:74f5f510cdcaeb2efd7c9f0676f39d39441264dd14366d8723aac3398ddedafb","observation_id":"1def5bb4-4838-401d-81b7-8a7abd37b3c1","resolution":{"observed_at":"2026-06-26T04:51:49.138026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T04:51:49.138026Z","title":"Large language models encode clinical knowledge.Nature, 620(7972):172–180, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:81a887a669d3f857cdc28ec95c7e46109784b7ac61309b0d57fe282fdff4e9c2","observation_id":"07333a12-b0f7-42c5-a605-94da497aeb8a","resolution":{"observed_at":"2026-06-26T04:51:49.138026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T04:51:49.138026Z","title":"Beyond the imitation game: Quantifying and extrapolating the capabilities of language models.Transactions on Machine Learning Research, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:561f5c138f9f0ea35477a5848360e2be294f909d1839dcb1d01fe9e2c32a067b","observation_id":"406dd38d-170c-49e5-89c0-cf3897fb5d86","resolution":{"observed_at":"2026-06-26T04:51:49.138026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-08-20T18:27:04.837880Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:7ff667629a422b08733dfa37a47a5de5966c861a4a7524cbd2a652e373178ef0","observation_id":"5494b441-111e-4715-9376-e3ecfedf3d3e","resolution":{"observed_at":"2026-07-04T13:49:52.298244Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T04:51:49.138026Z","title":"Large language models for education: A survey and outlook.IEEE Signal Processing Magazine, 42(6):51–63, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:5645c4d2d2ce930bd4eb7d0f4886703866011a3da74d683a143d4fc628694507","observation_id":"edf57d12-4f67-4230-9e57-233ec5aeda9b","resolution":{"observed_at":"2026-06-26T04:51:49.138026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":"1904.09675","doi":"10.48550/arxiv.1904.09675","metadata_source":"pith","pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BERTScore: Evaluating Text Generation with BERT","venue":"cs.CL","work_id":"9eaaaac1-0a96-4f5f-9b13-30c46e9e1346","year":2019},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:049d1514a3c036473bdb27688d2a6054177079320fbedd9ca781575ab8fe1822","observation_id":"c4d724dc-65d0-4b4b-9e56-c63ebc97e8ae","resolution":{"observed_at":"2026-07-04T13:49:52.308917Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T10:38:08.909666+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T10:38:08.909666+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T04:51:49.138026Z","title":"True or False","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T04:51:49.138026Z"},"links":{"citing_paper":"/paper/2606.27047"},"observation_digest":"sha256:f0b322f48ba0a2a81784364e4e75be17ca6e616d3b7113ca003a20e87674e7a1","observation_id":"8954013c-1bfa-47d8-ae94-63fc3645fd68","resolution":{"observed_at":"2026-06-26T04:51:49.138026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.27047","last_updated":"2026-06-25T13:52:16Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T01:20:07.541244Z","submitted_at":"2026-06-25T13:52:16Z","title":"NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":12,"verified_fuzzy":0},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2606.27047."}