Pith. sign in

Paper Citation Record · LEDGER

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models

As of 23 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2606.27047.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2606.27047 v1

Coverage vector

measured 30 of 30 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-06-26T04:51:49.138026Z

measured 30 of 30 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-23T06:30:58.430688+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

30 of 30 outbound references displayed

  • verified exact12
  • verified fuzzy0
  • unresolved18
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 9829b096-cb5f-477b-b48e-badb83f263a6 · outbound

This paper cites NuclearQA: A Human-Made Benchmark for Language Models for the Nuclear Domain.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models NuclearQA: A Human-Made Benchmark for Language Models for the Nuclear Domain

Reference 1

Resolution
verified exact
arxiv_id, observed 2026-07-04T13:49:52.283299Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:287eb4f77e0ef9199e20caec5bcfaa94dbdb7ce151d397eb64d3e338ff09762b

Observation 21013d31-042e-4728-812c-52faf585fb41 · outbound

This paper cites GPT-4 Technical Report.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models GPT-4 Technical Report

Reference 2

Resolution
verified exact
local_arxiv, observed 2026-07-04T13:49:52.283693Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:65bfe8f17e102af5cb45fbaeb0e4951732f2819645fe203eae1b21efc41abc51

Observation 8ffdd436-5a77-4c63-ae89-cd47b32077aa · outbound

This paper cites Prbench: Large-scale expert rubrics for evaluating high-stakes professional reasoning.arXiv preprint arXiv:2511.11562.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Prbench: Large-scale expert rubrics for evaluating high-stakes professional reasoning.arXiv preprint arXiv:2511.11562

Reference 3

Resolution
verified exact
arxiv_id, observed 2026-07-04T13:49:52.280343Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:13bf35c473c3a62be2c219745fe28be19102e82aeeee3383647d715308f1aa9d

Observation ec0191a9-cedd-4e43-b29e-53c3afda9134 · outbound

This paper cites Synthetic QA corpora generation with roundtrip consistency.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Synthetic QA corpora generation with roundtrip consistency

Reference 4

Resolution
unresolved
no resolver link, observed 2026-06-26T04:51:49.138026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:49d9f4adc6620fde8ab78a1e37cf2ba316ac8bca5f4b8a9f111b30676d2c5463

Observation ae440e9b-5fa0-414a-b60e-8856902d0ebd · outbound

This paper cites Nougat: Neural Optical Understanding for Academic Documents.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Nougat: Neural Optical Understanding for Academic Documents

Reference 5

Resolution
verified exact
local_arxiv, observed 2026-07-04T13:49:52.274705Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:f96b8a9792ed6b4575ab61e823a7af86ed6ae6ae87f4aa34447392d42f906610

Observation 9c0db56d-d097-4acd-a98f-9d878f62d636 · outbound

This paper cites Language models are few-shot learners.Advances in Neural Information Processing Systems, 33:1877–1901, 2020.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Language models are few-shot learners.Advances in Neural Information Processing Systems, 33:1877–1901, 2020

Reference 6

Resolution
unresolved
no resolver link, observed 2026-06-26T04:51:49.138026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:a2e495b01da308410113e3177157bc70510caf88fe988e12e7a2f4f9779721f7

Observation 37c5ede6-3cc1-4847-8c93-85058bbb8d2c · outbound

This paper cites A survey on evaluation of large language models.ACM transactions on Intelligent Systems and Technology, 15(3):1–45, 2024.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models A survey on evaluation of large language models.ACM transactions on Intelligent Systems and Technology, 15(3):1–45, 2024

Reference 7

Resolution
unresolved
no resolver link, observed 2026-06-26T04:51:49.138026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:50e205ceda41455d08501ad0e4e13f3884e3c2a602dbb49d4988151a70a187da

Observation dc855fb9-39a1-404b-bed1-f92377b3c823 · outbound

This paper cites A Survey on Large Language Models for Critical Societal Domains: Finance, Healthcare, and Law.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models A Survey on Large Language Models for Critical Societal Domains: Finance, Healthcare, and Law

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-07-04T13:49:52.305518Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:b98247fc87f37e78f11cad40ea94e652fb11e562e8876f862c1017637d1cf4a2

Observation fc1ba279-0685-45a9-9af6-afd93945df52 · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Training Verifiers to Solve Math Word Problems

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-07-04T13:49:52.301039Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:3029e9d9979f6ac86d595107fe94a95b9697f1e764f69309ace6074f6673530d

Observation 07cc8909-a109-48c2-9a1a-1162358c365a · outbound

This paper cites LegalBench: A collaboratively built benchmark for measuring legal reasoning in large language models.Advances in Neural Information Processing Systems, 36:44123–44279, 2023.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models LegalBench: A collaboratively built benchmark for measuring legal reasoning in large language models.Advances in Neural Information Processing Systems, 36:44123–44279, 2023

Reference 10

Resolution
unresolved
no resolver link, observed 2026-06-26T04:51:49.138026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:2a795c0e690559fa028f7d4368c14e3397c4fa0824858e285bb86ed8ad0484d7

Observation 5c50b657-2e31-4e3f-96f3-0a376d0f9d00 · outbound

This paper cites Measuring Massive Multitask Language Understanding.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Measuring Massive Multitask Language Understanding

Reference 11

Resolution
verified exact
local_arxiv, observed 2026-07-04T13:49:52.302205Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:0907368e0013abdb3ffdbe36939a256fbb73d245ca260ffc2a649ea0ca0df26d

Observation ba860b65-7835-49ec-b6f4-fc0627c7d12c · outbound

This paper cites Measuring Mathematical Problem Solving With the MATH Dataset.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Measuring Mathematical Problem Solving With the MATH Dataset

Reference 12

Resolution
verified exact
local_arxiv, observed 2026-07-04T13:49:52.309083Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:f2269ba7caccd104fa67b48cae22ed22d2bf10cd589b0ce98725a57ade74ea6f

Observation 4bd36d78-d83c-43de-b001-448ad8a5b306 · outbound

This paper cites A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions.ACM Transactions on Information Systems, 43(2):1–55, 2025.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions.ACM Transactions on Information Systems, 43(2):1–55, 2025

Reference 13

Resolution
unresolved
no resolver link, observed 2026-06-26T04:51:49.138026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:ba2309647c53b2be5c7c704ce02d07c9dd14d78e4c26ba07d0e4f5e1a9806499

Observation 9ace6daf-3051-4711-960e-768fe792592c · outbound

This paper cites Towards mitigating llm hallucination via self reflection.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Towards mitigating llm hallucination via self reflection

Reference 14

Resolution
unresolved
no resolver link, observed 2026-06-26T04:51:49.138026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:2beeb8cb35618e4fbeeccd3114d36487c8b1af60553189db3c9363b7b30807f1

Observation cb0475b5-6764-41d7-873d-413daae83bed · outbound

This paper cites Select high-quality synthetic QA pairs to augment training data in MRC under the reward guidance of generative language models.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Select high-quality synthetic QA pairs to augment training data in MRC under the reward guidance of generative language models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-06-26T04:51:49.138026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:111ec1f5fd13520c800a9ef8c37a0e876b10dbf312218c17d4421a4d7f8ed767

Observation 1fb487ad-8d67-4eb6-82c8-2b1241c09761 · outbound

This paper cites American Institute of Physics, 1977.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models American Institute of Physics, 1977

Reference 16

Resolution
unresolved
no resolver link, observed 2026-06-26T04:51:49.138026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:dde78dc702f35867a391e400dfd75c08315f1893bcbfd38b1b5907e7be1742c7

Observation 0aa74a25-50b1-487b-b8ca-aaf118fdf5e6 · outbound

This paper cites Holistic Evaluation of Language Models.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Holistic Evaluation of Language Models

Reference 17

Resolution
verified exact
local_arxiv, observed 2026-07-04T13:49:52.290181Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:611e1a02b1bc44d7acc17cd47314f10d37b94dc5fff9f9e6b203ca1760f1489c

Observation 1b4503b4-7461-47b2-a053-828161c7c822 · outbound

This paper cites G-Eval: NLG evaluation using GPT-4 with better human alignment.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models G-Eval: NLG evaluation using GPT-4 with better human alignment

Reference 18

Resolution
unresolved
no resolver link, observed 2026-06-26T04:51:49.138026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:6ef3e3c9166e68b69d20767ec6d29ba7f46b010308a63399d410140a49230498

Observation 692e06f8-6636-4c9d-bb83-b6b776ce3468 · outbound

This paper cites ExpertQA: Expert-curated questions and attributed answers.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models ExpertQA: Expert-curated questions and attributed answers

Reference 19

Resolution
unresolved
no resolver link, observed 2026-06-26T04:51:49.138026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:5d69f4a5fabc1f8f265c87e27819ee11073b93353dce95cc2a214cf7e2cc8303

Observation aaa36e4a-54ca-4aa5-8f17-cbfa2e7361e8 · outbound

This paper cites Sources of hallucination by large language models on inference tasks.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Sources of hallucination by large language models on inference tasks

Reference 20

Resolution
unresolved
no resolver link, observed 2026-06-26T04:51:49.138026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:73a1621243a1789aa27961c1bce55a4c1e0e4551cbfb6b55bf16d61517df484c

Observation 00c0789d-e639-4436-8e2a-c8dade83fadd · outbound

This paper cites Training question answering models from synthetic data.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Training question answering models from synthetic data

Reference 21

Resolution
unresolved
no resolver link, observed 2026-06-26T04:51:49.138026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:179c03c2df6d58b20ae494aab35d282260005576ee5fbffeb6dc6a9a6415a82d

Observation 634cd975-9cf9-415a-8422-bcf896036e17 · outbound

This paper cites SQuAD: 100,000+ questions for machine comprehension of text.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models SQuAD: 100,000+ questions for machine comprehension of text

Reference 22

Resolution
unresolved
no resolver link, observed 2026-06-26T04:51:49.138026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:aca54fb2a87173cd4c8e088ca9dfd14150035db110fc6228eded6c901b1f9ed9

Observation 9763c8e9-ad30-4410-8908-7028a63b7774 · outbound

This paper cites A Survey of Hallucination in Large Foundation Models.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models A Survey of Hallucination in Large Foundation Models

Reference 23

Resolution
verified exact
local_arxiv, observed 2026-07-04T13:49:52.295588Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:9375d71408dafda22a076f702d17c9b5c11bb7b10a7da068cbb443a86efde7b8

Observation 1def5bb4-4838-401d-81b7-8a7abd37b3c1 · outbound

This paper cites Ubiquity of LLM hallucinations across critical domains: A survey.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Ubiquity of LLM hallucinations across critical domains: A survey

Reference 24

Resolution
unresolved
no resolver link, observed 2026-06-26T04:51:49.138026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:74f5f510cdcaeb2efd7c9f0676f39d39441264dd14366d8723aac3398ddedafb

Observation 07333a12-b0f7-42c5-a605-94da497aeb8a · outbound

This paper cites Large language models encode clinical knowledge.Nature, 620(7972):172–180, 2023.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Large language models encode clinical knowledge.Nature, 620(7972):172–180, 2023

Reference 25

Resolution
unresolved
no resolver link, observed 2026-06-26T04:51:49.138026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:81a887a669d3f857cdc28ec95c7e46109784b7ac61309b0d57fe282fdff4e9c2

Observation 406dd38d-170c-49e5-89c0-cf3897fb5d86 · outbound

This paper cites Beyond the imitation game: Quantifying and extrapolating the capabilities of language models.Transactions on Machine Learning Research, 2023.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Beyond the imitation game: Quantifying and extrapolating the capabilities of language models.Transactions on Machine Learning Research, 2023

Reference 26

Resolution
unresolved
no resolver link, observed 2026-06-26T04:51:49.138026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:561f5c138f9f0ea35477a5848360e2be294f909d1839dcb1d01fe9e2c32a067b

Observation 5494b441-111e-4715-9376-e3ecfedf3d3e · outbound

This paper cites Gemini: A Family of Highly Capable Multimodal Models.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Gemini: A Family of Highly Capable Multimodal Models

Reference 27

Resolution
verified exact
local_arxiv, observed 2026-07-04T13:49:52.298244Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:7ff667629a422b08733dfa37a47a5de5966c861a4a7524cbd2a652e373178ef0

Observation edf57d12-4f67-4230-9e57-233ec5aeda9b · outbound

This paper cites Large language models for education: A survey and outlook.IEEE Signal Processing Magazine, 42(6):51–63, 2026.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Large language models for education: A survey and outlook.IEEE Signal Processing Magazine, 42(6):51–63, 2026

Reference 28

Resolution
unresolved
no resolver link, observed 2026-06-26T04:51:49.138026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:5645c4d2d2ce930bd4eb7d0f4886703866011a3da74d683a143d4fc628694507

Observation c4d724dc-65d0-4b4b-9e56-c63ebc97e8ae · outbound

This paper cites BERTScore: Evaluating Text Generation with BERT.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models BERTScore: Evaluating Text Generation with BERT

Reference 29

Resolution
verified exact
local_arxiv, observed 2026-07-04T13:49:52.308917Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:049d1514a3c036473bdb27688d2a6054177079320fbedd9ca781575ab8fe1822

Observation 8954013c-1bfa-47d8-ae94-63fc3645fd68 · outbound

This paper cites True or False.

NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models True or False

Reference 30

Resolution
unresolved
no resolver link, observed 2026-06-26T04:51:49.138026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-26T04:51:49.138026Z digest=sha256:f0b322f48ba0a2a81784364e4e75be17ca6e616d3b7113ca003a20e87674e7a1

Pith citing papers

No inbound Pith citation observations are available.