Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-06-26T04:51:49.138026Z
Paper Citation Record · LEDGER
As of 23 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2606.27047.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-06-26T04:51:49.138026Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-23T06:30:58.430688+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links
A source-named dated measurement, never combined with another source.
Source: cited_works
30 of 30 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation 9829b096-cb5f-477b-b48e-badb83f263a6 · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models NuclearQA: A Human-Made Benchmark for Language Models for the Nuclear Domain
Reference 1
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.
Observation 21013d31-042e-4728-812c-52faf585fb41 · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models GPT-4 Technical Report
Reference 2
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.
Observation 8ffdd436-5a77-4c63-ae89-cd47b32077aa · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Prbench: Large-scale expert rubrics for evaluating high-stakes professional reasoning.arXiv preprint arXiv:2511.11562
Reference 3
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.
Observation ec0191a9-cedd-4e43-b29e-53c3afda9134 · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Synthetic QA corpora generation with roundtrip consistency
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ae440e9b-5fa0-414a-b60e-8856902d0ebd · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Nougat: Neural Optical Understanding for Academic Documents
Reference 5
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.
Observation 9c0db56d-d097-4acd-a98f-9d878f62d636 · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Language models are few-shot learners.Advances in Neural Information Processing Systems, 33:1877–1901, 2020
Reference 6
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 37c5ede6-3cc1-4847-8c93-85058bbb8d2c · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models A survey on evaluation of large language models.ACM transactions on Intelligent Systems and Technology, 15(3):1–45, 2024
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation dc855fb9-39a1-404b-bed1-f92377b3c823 · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models A Survey on Large Language Models for Critical Societal Domains: Finance, Healthcare, and Law
Reference 8
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.
Observation fc1ba279-0685-45a9-9af6-afd93945df52 · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Training Verifiers to Solve Math Word Problems
Reference 9
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.
Observation 07cc8909-a109-48c2-9a1a-1162358c365a · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models LegalBench: A collaboratively built benchmark for measuring legal reasoning in large language models.Advances in Neural Information Processing Systems, 36:44123–44279, 2023
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5c50b657-2e31-4e3f-96f3-0a376d0f9d00 · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Measuring Massive Multitask Language Understanding
Reference 11
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.
Observation ba860b65-7835-49ec-b6f4-fc0627c7d12c · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Measuring Mathematical Problem Solving With the MATH Dataset
Reference 12
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.
Observation 4bd36d78-d83c-43de-b001-448ad8a5b306 · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions.ACM Transactions on Information Systems, 43(2):1–55, 2025
Reference 13
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9ace6daf-3051-4711-960e-768fe792592c · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Towards mitigating llm hallucination via self reflection
Reference 14
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation cb0475b5-6764-41d7-873d-413daae83bed · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Select high-quality synthetic QA pairs to augment training data in MRC under the reward guidance of generative language models
Reference 15
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1fb487ad-8d67-4eb6-82c8-2b1241c09761 · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models American Institute of Physics, 1977
Reference 16
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 0aa74a25-50b1-487b-b8ca-aaf118fdf5e6 · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Holistic Evaluation of Language Models
Reference 17
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.
Observation 1b4503b4-7461-47b2-a053-828161c7c822 · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models G-Eval: NLG evaluation using GPT-4 with better human alignment
Reference 18
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 692e06f8-6636-4c9d-bb83-b6b776ce3468 · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models ExpertQA: Expert-curated questions and attributed answers
Reference 19
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation aaa36e4a-54ca-4aa5-8f17-cbfa2e7361e8 · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Sources of hallucination by large language models on inference tasks
Reference 20
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 00c0789d-e639-4436-8e2a-c8dade83fadd · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Training question answering models from synthetic data
Reference 21
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 634cd975-9cf9-415a-8422-bcf896036e17 · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models SQuAD: 100,000+ questions for machine comprehension of text
Reference 22
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9763c8e9-ad30-4410-8908-7028a63b7774 · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models A Survey of Hallucination in Large Foundation Models
Reference 23
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.
Observation 1def5bb4-4838-401d-81b7-8a7abd37b3c1 · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Ubiquity of LLM hallucinations across critical domains: A survey
Reference 24
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 07333a12-b0f7-42c5-a605-94da497aeb8a · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Large language models encode clinical knowledge.Nature, 620(7972):172–180, 2023
Reference 25
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 406dd38d-170c-49e5-89c0-cf3897fb5d86 · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Beyond the imitation game: Quantifying and extrapolating the capabilities of language models.Transactions on Machine Learning Research, 2023
Reference 26
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5494b441-111e-4715-9376-e3ecfedf3d3e · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Gemini: A Family of Highly Capable Multimodal Models
Reference 27
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.
Observation edf57d12-4f67-4230-9e57-233ec5aeda9b · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models Large language models for education: A survey and outlook.IEEE Signal Processing Magazine, 42(6):51–63, 2026
Reference 28
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation c4d724dc-65d0-4b4b-9e56-c63ebc97e8ae · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models BERTScore: Evaluating Text Generation with BERT
Reference 29
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.
Observation 8954013c-1bfa-47d8-ae94-63fc3645fd68 · outbound
NuclearQAv2: A Structured Benchmark for Evaluating Domain-Science Competence in Large Language Models True or False
Reference 30
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
No inbound Pith citation observations are available.