Pith. sign in

Paper Citation Record · LEDGER

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning

As of 8 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 5 inbound Pith citation observations for arXiv:2505.19501.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.19501 v2

Coverage vector

measured 50 of 50 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:16:36.509160Z

measured 55 of 55 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 5 of 5 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:16:36.029822Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

50 of 50 outbound references displayed

  • verified exact2
  • verified fuzzy11
  • unresolved37
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

0
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

Observation afea2159-1a30-42ab-b491-9dbae7c6f438 · outbound

This paper cites https://groups.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning https://groups

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:39.579019Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:16:32.587229Z digest=sha256:80e83142a8a0aed46f83a432b081336b0a0e0d687cd2f4d20ba46cfb1fca2f35

Observation 98928a95-ae8b-49ba-95c7-d9675e3662e6 · outbound

This paper cites Publicly Available Clinical BERT Embeddings.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Publicly Available Clinical BERT Embeddings

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:32.630844Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:32.630844Z digest=sha256:5f05b268c74646c3b74b0f50d2072ba0af90c7349c62ae1141f61db3a682157a

Observation ec5f7560-c4fe-4f4e-b909-30935d26a96c · outbound

This paper cites SciBERT: A Pretrained Language Model for Scientific Text.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning SciBERT: A Pretrained Language Model for Scientific Text

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:32.723398Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:32.723398Z digest=sha256:36d6cbdcdd60b2b3a3764aae4321ecd6d123d2f08907a985b581460784f6d972

Observation 95578303-0a4e-43f2-8890-0b52b5acb70c · outbound

This paper cites SciAssess: Benchmarking LLM Proficiency in Scientific Literature Analysis.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning SciAssess: Benchmarking LLM Proficiency in Scientific Literature Analysis

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:32.807425Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:32.807425Z digest=sha256:2e5b86a26c374e12d01bb885db5c7137281b203f6ad1ee81558f3a39f007199c

Observation e4b22f4d-898f-4f46-9fba-5bcad3ffbc6f · outbound

This paper cites MaxMin-RLHF: Alignment with Diverse Human Preferences.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning MaxMin-RLHF: Alignment with Diverse Human Preferences

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:32.906989Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:32.906989Z digest=sha256:eb99b7d60233a0af4cce1c541171e3f88c3108534732b245fefada5696989434

Observation 83a7ae87-6a9a-46b3-ac06-a3b7d5c2023c · outbound

This paper cites Deep reinforcement learning from human preferences.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Deep reinforcement learning from human preferences

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:39.374637Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:16:33.000519Z digest=sha256:55986c32321e9b0bdc3e3935510c8b276a77475a908c0ed1017d55bdf76d467e

Observation 75646ddd-da90-4e10-8468-4bf1706831ad · outbound

This paper cites A 5′ utr language model for decoding untranslated regions of mrna and function predictions.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning A 5′ utr language model for decoding untranslated regions of mrna and function predictions

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:39.099082Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:16:33.064419Z digest=sha256:9b1c7055f25f0199b791379551204b83dd1634f161fb38db4bd7c1ba21a225d6

Observation 1918dbac-c09e-49cf-bc17-08613e799728 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:33.136460Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:33.136460Z digest=sha256:8e480cbf76acae5f65263e35b80f32c757f9b91832963e5e9a718786aa8131f1

Observation a7ef9dc2-1148-494b-bc6c-906cf4dcb15e · outbound

This paper cites Temporal consistency for llm reasoning process error identification.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Temporal consistency for llm reasoning process error identification

Reference 9

Resolution
verified exact
raw_fallback, observed 2026-08-07T14:16:37.578310Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:16:33.252728Z digest=sha256:51d340fc882f9665ce77ecd07da67e4f76cd402cb3b3240dc62e304793ad95de

Observation 3ff156e0-1d28-4814-a7ca-3c65c51b2479 · outbound

This paper cites Embodied LLM Agents Learn to Cooperate in Organized Teams.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Embodied LLM Agents Learn to Cooperate in Organized Teams

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:33.324986Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:33.324986Z digest=sha256:02083a13345224847bea3536788bb9db10b013ee9bab4cc1beacb183a5ea107f

Observation 64f9b7dc-1b6b-405d-833b-2162ea59247f · outbound

This paper cites Math-perturb: Benchmarking llms’ math reasoning abilities against hard perturbations.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Math-perturb: Benchmarking llms’ math reasoning abilities against hard perturbations

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:38.936618Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:16:33.400906Z digest=sha256:5f286b46e0f432db0917505e9e934a005622dacf656f4c623b7ceffe901390d6

Observation 24d7bf2b-47c5-4494-b0a8-a3bbcfec2ef8 · outbound

This paper cites Crispr-gpt: An llm agent for automated design of gene-editing experiments.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Crispr-gpt: An llm agent for automated design of gene-editing experiments

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:38.786177Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:16:33.487464Z digest=sha256:cb4491d26ad70f2346a98cb6e8b2d4e0233b5b8f99a9186ed12fde5ad3aed67f

Observation ac6f6e28-6b99-4c06-a28e-2d2507c3c7ea · outbound

This paper cites A Survey on Large Language Models for Code Generation.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning A Survey on Large Language Models for Code Generation

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:33.563390Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:33.563390Z digest=sha256:0d844304f7e637e1b364804d966b11f7bb5f4df6247dc2e3902e016c8a9689ff

Observation d6eafb56-a2a7-4cfc-8e9c-54abbfa772b6 · outbound

This paper cites What disease does this patient have? a large-scale open domain question answering dataset from medical exams.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning What disease does this patient have? a large-scale open domain question answering dataset from medical exams

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:38.645884Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:16:33.651898Z digest=sha256:aee4a0dc3687a5eba07479e1a9cb1fdad9d7ee8d68230cb9687d652eafc5c3da

Observation f33a9524-a96c-4116-884a-000a202120a4 · outbound

This paper cites PubMedQA: A Dataset for Biomedical Research Question Answering.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning PubMedQA: A Dataset for Biomedical Research Question Answering

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:33.769378Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:33.769378Z digest=sha256:1ef3269f52619ae22841bfb2ddeaa1f036783f2e78577105015d95c3c02f5b0c

Observation 1cdd6523-8ddc-4899-b1e9-b1baf5e61344 · outbound

This paper cites Bioasq-qa: A manually curated corpus for biomedical question answering.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Bioasq-qa: A manually curated corpus for biomedical question answering

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:38.500172Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:16:33.839083Z digest=sha256:a528e7677faf2a816a9f9cf73d3e2c7b21003ee82a60342138caaf46fe6eb108

Observation b7fa524b-9938-4b67-87b6-074d9acbade0 · outbound

This paper cites Training Language Models to Self-Correct via Reinforcement Learning.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Training Language Models to Self-Correct via Reinforcement Learning

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:33.944484Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:33.944484Z digest=sha256:73d916d8da0512d49f55465ad1e50275377a460c9273c17abbf9f894d3c93620

Observation 2b06293d-b9af-4ed1-ae10-8ded4e7c4f18 · outbound

This paper cites Tulu 3: Pushing Frontiers in Open Language Model Post-Training.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Tulu 3: Pushing Frontiers in Open Language Model Post-Training

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:34.024067Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:34.024067Z digest=sha256:926080dfcdb6e2a004bae7d9fad82288497d0170a043ea4898fdc23e2bf1c6ce

Observation 5a98f1ac-515c-4c98-8df5-36f402dc2723 · outbound

This paper cites LAB-Bench: Measuring Capabilities of Language Models for Biology Research.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning LAB-Bench: Measuring Capabilities of Language Models for Biology Research

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:34.099327Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:34.099327Z digest=sha256:0dd420240da9c2a63c7291f83b8f98e318d7374ba74a009b5422f86c0f2b053a

Observation 77bbd0b2-17ea-4458-9a67-bf64eef549bc · outbound

This paper cites Biobert: a pre-trained biomedical language representation model for biomedical text mining.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Biobert: a pre-trained biomedical language representation model for biomedical text mining

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:34.189406Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:34.189406Z digest=sha256:6c7e6a54e063b3b89532b54b4a7a5678c05d7dda9e2f9bf33ecfb54fd6f59986

Observation e6a6037e-1978-4a79-95c8-48a164660ba6 · outbound

This paper cites Mapping the Increasing Use of LLMs in Scientific Papers.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Mapping the Increasing Use of LLMs in Scientific Papers

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:34.285798Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:34.285798Z digest=sha256:7e252751582fd50c6ae03f63c908a6373082e08c9283474683815bada021c486

Observation 33172ea8-d605-4bde-a5d1-e304650e5cb8 · outbound

This paper cites Understanding R1-Zero-Like Training: A Critical Perspective.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Understanding R1-Zero-Like Training: A Critical Perspective

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:34.365003Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:34.365003Z digest=sha256:d045b089f31da468754d68ee245ccfb0dcea3429a5aa5f1d101edd893fa72bbd

Observation f8694ac4-f500-4491-96bc-cfff4e84cfcf · outbound

This paper cites Biogpt: generative pre-trained transformer for biomedical text generation and mining.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Biogpt: generative pre-trained transformer for biomedical text generation and mining

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:38.339770Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:16:34.436232Z digest=sha256:c1ae2c1118a9a76024d66dd5ea5cbf8b3be4f6da90c5e5969e9604ce67ae0310

Observation 61c29d7e-f8ba-48c3-9696-7523461a9b8a · outbound

This paper cites BioMedGPT: Open Multimodal Generative Pre-trained Transformer for BioMedicine.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning BioMedGPT: Open Multimodal Generative Pre-trained Transformer for BioMedicine

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:34.525450Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:34.525450Z digest=sha256:ccf64c77cc27726e604e5b2727f9b99fe07e2314064b2cc55e04b11c5f390c8d

Observation 6a9d5b13-ca7d-4bd3-86df-09cefabe942b · outbound

This paper cites Covid-qa: A question answering dataset for covid-19.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Covid-qa: A question answering dataset for covid-19

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:38.178198Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:16:34.619750Z digest=sha256:f274b88b29594b0657d8ee2ff1eb33996c7f56da5ee3ec3751e949f3dabceaa0

Observation 212554fe-81aa-4ae6-826e-3be54a7976f7 · outbound

This paper cites Training language models to follow instructions with human feedback.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Training language models to follow instructions with human feedback

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:38.027226Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:16:34.712194Z digest=sha256:77a4864ea7d4719a8a63271e38713403ff128b9138c38d56a3529bc5b2c32cb4

Observation ec343161-45bc-43cb-ba87-66f2b60092bd · outbound

This paper cites Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Medmcqa: A large-scale multi-subject multi-choice dataset for medical domain question answering

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:34.770907Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:34.770907Z digest=sha256:d6d479998cf4e36414fa3fd50bd124a4f1f1a041fc85c3fee450b47c8319fbc9

Observation 77d25e6f-a006-435a-be4b-15f8fd6de7a2 · outbound

This paper cites A domain- specific next-generation large language model (llm) or chatgpt is required for biomedical engineering and research.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning A domain- specific next-generation large language model (llm) or chatgpt is required for biomedical engineering and research

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:16:37.871064Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:16:34.829896Z digest=sha256:5703e5c59ff1d8ad02281cd1410b9aa3ef16ed237eaffa60a67ddae64cd65c21

Observation 1153b7b9-16d3-4381-8ba0-ecd68bac0d78 · outbound

This paper cites Humanity's Last Exam.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Humanity's Last Exam

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:34.919303Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:34.919303Z digest=sha256:f9ed9183b9386538f6a17b4ac2b17d57ebd8822ee815517d6a7e3acf838a906d

Observation c6f1273f-6232-412d-8f21-579df929b853 · outbound

This paper cites SciFive: a text-to-text transformer model for biomedical literature.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning SciFive: a text-to-text transformer model for biomedical literature

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.015805Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.015805Z digest=sha256:0bf5be213b59363c051a5581bd9f287e1e69b82c6b9bf9a8cf78eb8ef51f95ed

Observation 398dcbeb-5310-4dbe-bf77-71a92d4be9d6 · outbound

This paper cites OmniScience: A Domain-Specialized LLM for Scientific Reasoning and Discovery.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning OmniScience: A Domain-Specialized LLM for Scientific Reasoning and Discovery

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.092269Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.092269Z digest=sha256:89d0870a516b16d8ec496a0325ea181f53e0b10eef62e784156ebb026d6fbcbb

Observation 01f58c65-b194-47b9-bdd7-73f99773a326 · outbound

This paper cites Gpqa: A graduate-level google-proof q&a benchmark.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Gpqa: A graduate-level google-proof q&a benchmark

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.171091Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.171091Z digest=sha256:ba272637ad2a1a9abd52aca8776dfe65a9b20127738af0c9d5ded00dc06f436f

Observation f1dbd3a9-b21d-4d71-ab50-a65683f5700f · outbound

This paper cites Proximal Policy Optimization Algorithms.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Proximal Policy Optimization Algorithms

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.239501Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.239501Z digest=sha256:86e86f7e0b932ac3b07d0363b9396e425f975619d683d2c182ca580721762e7b

Observation 53a1d2b6-08e4-4829-8fe3-83f970070603 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.320838Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.320838Z digest=sha256:44fe4dffdfdf2738e7617a18f51f25adba3d969930d8762134711d9e4a84b0b3

Observation d0279c49-b79e-457c-9f38-f64049913834 · outbound

This paper cites Reflexion: Language agents with verbal reinforcement learning.Advances in Neural Information Processing Systems, 36, 2024.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Reflexion: Language agents with verbal reinforcement learning.Advances in Neural Information Processing Systems, 36, 2024

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.377873Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.377873Z digest=sha256:d79ae381d02c2ade6bfa3fbb1c57e6403c13fee8d90eb92518977a110970a79b

Observation e2d81dc0-19e9-4631-953a-61b9f0b2d066 · outbound

This paper cites R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.431025Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.431025Z digest=sha256:ec10e0acf981cd4e08cb87788642b9a3985b31257e996c7d1b4cfc1fdf4170b3

Observation 11ccb532-811a-4fa2-a7c2-9f49545af144 · outbound

This paper cites Galactica: A Large Language Model for Science.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Galactica: A Large Language Model for Science

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.497267Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.497267Z digest=sha256:991c2f6081b2c1eb33e98d54880cd28c4f28fd8d7637f289761da2393bcf130a

Observation 00e70ae3-52f4-48ff-9b2c-d3a0eb1a415b · outbound

This paper cites A call for built-in biosecurity safeguards for generative ai tools.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning A call for built-in biosecurity safeguards for generative ai tools

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.578517Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.578517Z digest=sha256:4ab83070eeb61513c10a22c2f0f80e93582e78f37388b16ebf015cb9365567ce

Observation 5a8f5076-31cb-4081-a8a1-dd64cc10cea3 · outbound

This paper cites Math-shepherd: Verify and reinforce llms step-by-step without human annotations.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Math-shepherd: Verify and reinforce llms step-by-step without human annotations

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.641355Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.641355Z digest=sha256:cebec2a88c9cc4b270b9c72cc9a55d47f297a3a69c88103c2169986e98241776

Observation 7f645668-9c8f-4882-b23b-0fe5ee70045a · outbound

This paper cites Pairwise Proximal Policy Optimization: Harnessing Relative Feedback for LLM Alignment.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Pairwise Proximal Policy Optimization: Harnessing Relative Feedback for LLM Alignment

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.711109Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.711109Z digest=sha256:d2f1d8cbdb953ee28a2d699484a059a92005a3acb489eb8c0282def897bdf74e

Observation b5447346-bd0c-432b-8df5-a6d32676b0b1 · outbound

This paper cites DARWIN Series: Domain Specific Large Language Models for Natural Science.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning DARWIN Series: Domain Specific Large Language Models for Natural Science

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.778875Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.778875Z digest=sha256:d23a05c27ae8774a11a69ab24e77552961a00576988220acd4687305a3dcc1c4

Observation bc56ceb1-ca1e-45ab-a9e7-534e7fc3ea92 · outbound

This paper cites A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.860086Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.860086Z digest=sha256:b94750cfef7a5425997f3668ea4709acfff7abdfba8dfdf7d62587f6c2b12392

Observation bc33c128-912a-46f2-b9d8-2183cc8c76cf · outbound

This paper cites ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.917247Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.917247Z digest=sha256:337847abf97f66f059d556fc9248636cdbcdbb5b2151d246e787865b47160e83

Observation 092e32ff-81b6-4a4c-b27c-8426ce22c4ec · outbound

This paper cites GatorTron: A Large Clinical Language Model to Unlock Patient Information from Unstructured Electronic Health Records.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning GatorTron: A Large Clinical Language Model to Unlock Patient Information from Unstructured Electronic Health Records

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:35.973838Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:35.973838Z digest=sha256:6e378a3fa191d0475646b2f128ebf4eadc81526c26e54c66fa298f64a21562ff

Observation e54ca4a9-5f34-48a3-bb04-952e8cce4afc · outbound

This paper cites Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:36.029822Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:36.029822Z digest=sha256:cab5f75f6ecf8f35080aa7b3cd407949e77adf57b596fffaf9b5d62ca79d8d48

Observation a53ce49d-145b-4e6a-ac43-cc76e727053d · outbound

This paper cites DAPO: An Open-Source LLM Reinforcement Learning System at Scale.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:36.086883Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:36.086883Z digest=sha256:aa3eb0d86defcb1c0dc1ae9650c37ecd558c5ad2f9d9f73bc006f8724472d223

Observation 82e82881-5bed-4ba4-b91c-2b451aba0c5c · outbound

This paper cites BioBART: Pretraining and Evaluation of A Biomedical Generative Language Model.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning BioBART: Pretraining and Evaluation of A Biomedical Generative Language Model

Reference 47

Resolution
verified exact
local_arxiv, observed 2026-08-07T14:16:36.808890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:16:36.154616Z digest=sha256:df7cc047c178129cb803de61d317a611233787e235e66ff82532e2ca8f4928ea

Observation 2c79a4eb-c102-4f33-bc36-b20ffc301b21 · outbound

This paper cites A generalist vision–language foundation model for diverse biomedical tasks.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning A generalist vision–language foundation model for diverse biomedical tasks

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:36.214381Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:36.214381Z digest=sha256:7762066e014dc6bfd0ff7ed4402f881766e47a8dbe8c6d61b4b599dc42b78e07

Observation f38840b1-f1c2-48c1-a399-4e3266f637bd · outbound

This paper cites Scientific large language models: A survey on biological & chemical domains.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Scientific large language models: A survey on biological & chemical domains

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:36.302753Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:36.302753Z digest=sha256:435ddec7fcc33f6c4332822974d00cb7dbf2e20c54827a4f72d233332adb6bcf

Observation d3bbb883-9740-4886-bf2b-91166959f7c4 · outbound

This paper cites DPO Meets PPO: Reinforced Token Optimization for RLHF.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning DPO Meets PPO: Reinforced Token Optimization for RLHF

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:36.509160Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:36.509160Z digest=sha256:78af7669d6567ee08978f7109babbf8ced673c6013c2b84487febeadc85aee6f

Pith citing papers

Observation e54ca4a9-5f34-48a3-bb04-952e8cce4afc · inbound

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning cites this paper.

Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T14:16:36.029822Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:16:36.029822Z digest=sha256:cab5f75f6ecf8f35080aa7b3cd407949e77adf57b596fffaf9b5d62ca79d8d48

Observation 061e31b1-ba24-4b77-b94f-eef42f8dd929 · inbound

Bottom-up Domain-specific Superintelligence: A Reliable Knowledge Graph is What We Need cites this paper.

Bottom-up Domain-specific Superintelligence: A Reliable Knowledge Graph is What We Need Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-06T16:17:42.986386Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:17:42.986386Z digest=sha256:0fc19e731e3c93c72b74a065858c71c12f2ef645fb0c089c979cbfd92e77845f

Observation 836537d0-3232-4b45-9326-727cb0c321c3 · inbound

Evaluating Large Language Models in Scientific Discovery cites this paper.

Evaluating Large Language Models in Scientific Discovery Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning

Reference 47

Resolution
verified exact
arxiv_id, observed 2026-05-16T21:48:34.403311Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-05-16T21:47:09.588941Z digest=sha256:844830a26895e002578b765668757ecd7a81fbc23cda684256e7bd3403754795

Observation 35dc85c7-1183-4668-ac4d-9ddacfbfa3d3 · inbound

Heterogeneous Scientific Foundation Model Collaboration cites this paper.

Heterogeneous Scientific Foundation Model Collaboration Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning

Reference 40

Resolution
verified exact
arxiv_id, observed 2026-05-09T04:30:11.969332Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-07T08:50:05.980191Z digest=sha256:9d5a69bf8bf6e058c4a3a9863d6df515c80f2a7c991f24f69e5d3816ff1cd748

Observation ca5363fa-0429-4cc9-82e4-98d5859b14cb · inbound

How Post-Training Shapes Biological Reasoning Models cites this paper.

How Post-Training Shapes Biological Reasoning Models Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning

Reference 72

Resolution
verified exact
arxiv_id, observed 2026-07-01T07:55:31.065267Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-07-01T07:48:31.110861Z digest=sha256:9e82240052bf32b15cd4f2fbcfb2a5b9b07fc1b275608e4e8670abeacabd019a